ai-toolkit-rules
Mandatory engineering, security, testing, git, performance, quality, and response rules.…
Evaluates RAG retrieval and LLM-as-judge metrics (faithfulness, relevancy, context precision). Triggers: measure RAG quality, knowledge gap, RAG eval, golden dataset.
$ npx -y skills add softspark/ai-toolkit --skill evaluate --agent claude-codeHow it fires
How this skill gets triggered: by you, by Claude, or both.
/evaluateContext preview
The summary Claude sees to decide when to auto-load this skill.
Evaluates RAG retrieval and LLM-as-judge metrics (faithfulness, relevancy, context precision). Triggers: measure RAG quality, knowledge gap, RAG eval, golden dataset.
name: evaluate description: "Evaluates RAG retrieval and LLM-as-judge metrics (faithfulness, relevancy, context precision). Triggers: measure RAG quality, knowledge gap, RAG eval, golden dataset." effort: medium disable-model-invocation: true argument-hint: "[--threshold N]" allowed-tools: Bash, Read
Evaluate RAG quality using LLM-as-a-Judge methodology.
/evaluate [--threshold 0.7]
# Run RAG evaluation python3 scripts/evaluate_rag.py # With custom thresholds python3 scripts/evaluate_rag.py \ --faithfulness 0.7 \ --relevancy 0.7 \ --context 0.6 # Detect knowledge gaps python3 scripts/knowledge_gaps.py --detect # Generate gap report python3 scripts/knowledge_gaps.py --report
# Replace {api-container} with your API server container name
docker exec {api-container} python3 scripts/evaluate_rag.py
# With custom thresholds
docker exec {api-container} python3 scripts/evaluate_rag.py \
--faithfulness 0.7 \
--relevancy 0.7 \
--context 0.6
# Detect knowledge gaps
docker exec {api-container} python3 scripts/knowledge_gaps.py --detect
# Generate gap report
docker exec {api-container} python3 scripts/knowledge_gaps.py --report| Metric | Description | Target | |--------|-------------|--------| | **Faithfulness** | Is answer based on context? | >70% | | **Relevancy** | Does answer address question? | >70% | | **Context Precision** | Is found context accurate? | >60% |
1. **Generate test queries** from golden dataset 2. **Execute RAG pipeline** for each query 3. **LLM judges** each response on metrics 4. **Report** aggregate scores
Located at: `scripts/golden_dataset.json` (or project-specific path)
{
"queries": [
{
"query": "How to configure rate limiting?",
"expected_topics": ["nginx", "rate-limiting"],
"expected_sources": ["kb/nginx/howto/rate-limiting.md"]
}
]
}RAG Evaluation Results ====================== Total Queries: 50 Average Faithfulness: 0.82 Average Relevancy: 0.78 Average Context Precision: 0.71 Quality: GOOD Failed Queries (faithfulness < 0.7): - Query: "How to backup PostgreSQL?" Score: 0.45 Issue: No relevant documents found
After evaluation, check for gaps:
# Direct execution
python3 scripts/knowledge_gaps.py --detect
# Docker execution
docker exec {api-container} python3 scripts/knowledge_gaps.py --detectOutput:
Knowledge Gaps Detected: 1. PostgreSQL backup procedures (5 failed queries) 2. Redis caching configuration (3 failed queries) 3. Ollama model selection (2 failed queries)
AI coding toolkit with machine-enforced safety, 116 skills, 44 agents, lifecycle hooks, persona presets, opt-in plugin packs, and benchmark tooling.
Repo: softspark/ai-toolkit
Mandatory engineering, security, testing, git, performance, quality, and response rules.…
Searches past coding sessions for observations, decisions, context. Triggers: mem-search,…
Accessibility validator: WCAG 2.1 AA, EN 301 549, EAA. Triggers: a11y, accessibility, WCAG,…
Creates new specialized agents with frontmatter, tools, delegation. Triggers: new agent,…
Analyzes code quality, complexity, patterns across codebase. Triggers: quality report,…
API design: naming, versioning, pagination, idempotency, OpenAPI, error contracts and safe…