/eval
管理评测驱动开发(eval-driven development)工作流。
> /plugin marketplace add xu-xiang/everything-claude-code-zh > /plugin install everything-claude-code@everything-claude-code
How it fires
How this command gets triggered: by you, by Claude, or both.
- Fires itselfClaude auto-loads it when your prompt matches the work.
- You can call itInvoke it directly when you want it.
- Slash command
/eval
Context preview
What this command does when you run it.
管理评测驱动开发(eval-driven development)工作流。
Command definition
eval.md评测命令(Eval Command)
管理评测驱动开发(eval-driven development)工作流。
用法(Usage)
`/eval [define|check|report|list] [feature-name]`
定义评测(Define Evals)
`/eval define feature-name`
创建一个新的评测定义:
1. 创建 `.claude/evals/feature-name.md` 文件,使用以下模板:
## EVAL: feature-name
创建时间:$(date)
### 能力评测(Capability Evals)
- [ ] [能力描述 1]
- [ ] [能力描述 2]
### 回归评测(Regression Evals)
- [ ] [现有行为 1 仍然正常工作]
- [ ] [现有行为 2 仍然正常工作]
### 通过准则(Success Criteria)
- 能力评测(capability evals)的 pass@3 > 90%
- 回归评测(regression evals)的 pass^3 = 100%
2. 提示用户填写具体准则。
检查评测(Check Evals)
`/eval check feature-name`
运行特定功能的评测:
1. 从 `.claude/evals/feature-name.md` 读取评测定义。 2. 对于每一项能力评测:
- 尝试验证准则。
- 记录 PASS/FAIL。
- 在 `.claude/evals/feature-name.log` 中记录尝试日志。
3. 对于每一项回归评测:
- 运行相关测试。
- 与基准(baseline)进行对比。
- 记录 PASS/FAIL。
4. 报告当前状态:
EVAL CHECK: feature-name
========================
能力(Capability): X/Y 通过
回归(Regression): X/Y 通过
状态(Status): 进行中(IN PROGRESS)/ 已就绪(READY)
生成报告(Report Evals)
`/eval report feature-name`
生成完整的评测报告:
EVAL REPORT: feature-name
=========================
生成时间:$(date)
能力评测(CAPABILITY EVALS)
----------------
[eval-1]: PASS (pass@1)
[eval-2]: PASS (pass@2) - 需重试
[eval-3]: FAIL - 见备注
回归评测(REGRESSION EVALS)
----------------
[test-1]: PASS
[test-2]: PASS
[test-3]: PASS
指标(METRICS)
-------
能力 pass@1: 67%
能力 pass@3: 100%
回归 pass^3: 100%
备注(NOTES)
-----
[任何问题、边界情况或观察结果]
建议(RECOMMENDATION)
--------------
[可发布(SHIP)/ 需改进(NEEDS WORK)/ 阻塞(BLOCKED)]
列出评测(List Evals)
`/eval list`
显示所有评测定义:
EVAL DEFINITIONS
================
feature-auth [3/5 通过] 进行中(IN PROGRESS)
feature-search [5/5 通过] 已就绪(READY)
feature-export [0/4 通过] 未开始(NOT STARTED)
参数(Arguments)
$ARGUMENTS:
- `define <name>` - 创建新的评测定义。
- `check <name>` - 运行并检查评测。
- `report <name>` - 生成完整报告。
- `list` - 显示所有评测。
- `clean` - 清除旧的评测日志(保留最近 10 次运行记录)。
Read more
评测命令(Eval Command)
管理评测驱动开发(eval-driven development)工作流。
用法(Usage)
`/eval [define|check|report|list] [feature-name]`
定义评测(Define Evals)
`/eval define feature-name`
创建一个新的评测定义:
1. 创建 `.claude/evals/feature-name.md` 文件,使用以下模板:
## EVAL: feature-name 创建时间:$(date) ### 能力评测(Capability Evals) - [ ] [能力描述 1] - [ ] [能力描述 2] ### 回归评测(Regression Evals) - [ ] [现有行为 1 仍然正常工作] - [ ] [现有行为 2 仍然正常工作] ### 通过准则(Success Criteria) - 能力评测(capability evals)的 pass@3 > 90% - 回归评测(regression evals)的 pass^3 = 100%
2. 提示用户填写具体准则。
检查评测(Check Evals)
`/eval check feature-name`
运行特定功能的评测:
1. 从 `.claude/evals/feature-name.md` 读取评测定义。 2. 对于每一项能力评测:
- 尝试验证准则。
- 记录 PASS/FAIL。
- 在 `.claude/evals/feature-name.log` 中记录尝试日志。
3. 对于每一项回归评测:
- 运行相关测试。
- 与基准(baseline)进行对比。
- 记录 PASS/FAIL。
4. 报告当前状态:
EVAL CHECK: feature-name ======================== 能力(Capability): X/Y 通过 回归(Regression): X/Y 通过 状态(Status): 进行中(IN PROGRESS)/ 已就绪(READY)
生成报告(Report Evals)
`/eval report feature-name`
生成完整的评测报告:
EVAL REPORT: feature-name ========================= 生成时间:$(date) 能力评测(CAPABILITY EVALS) ---------------- [eval-1]: PASS (pass@1) [eval-2]: PASS (pass@2) - 需重试 [eval-3]: FAIL - 见备注 回归评测(REGRESSION EVALS) ---------------- [test-1]: PASS [test-2]: PASS [test-3]: PASS 指标(METRICS) ------- 能力 pass@1: 67% 能力 pass@3: 100% 回归 pass^3: 100% 备注(NOTES) ----- [任何问题、边界情况或观察结果] 建议(RECOMMENDATION) -------------- [可发布(SHIP)/ 需改进(NEEDS WORK)/ 阻塞(BLOCKED)]
列出评测(List Evals)
`/eval list`
显示所有评测定义:
EVAL DEFINITIONS ================ feature-auth [3/5 通过] 进行中(IN PROGRESS) feature-search [5/5 通过] 已就绪(READY) feature-export [0/4 通过] 未开始(NOT STARTED)
参数(Arguments)
$ARGUMENTS:
- `define <name>` - 创建新的评测定义。
- `check <name>` - 运行并检查评测。
- `report <name>` - 生成完整报告。
- `list` - 显示所有评测。
- `clean` - 清除旧的评测日志(保留最近 10 次运行记录)。
🌐 Language / 语言 / 語言 为 AI 智能体(Agent)框架打造的性能优化系统。源自 Anthropic 黑客松获胜作品。 这不仅仅是配置文件。它是一个完整的系统:包含技能(Skills)、本能(Instincts)、内存优化、持续学习、安全扫描以及研究优先的开发模式。这些生产级的智能体(Agents)、钩子(Hooks)、命令(Commands)、规则(Rules)以及 MCP 配置,是在构建真实产品的 10 个多月高强度日常使用中演化而来的。 适用于 Claude Code, Codex,
Repo: xu-xiang/everything-claude-code-zh
Other commands on everything-claude-code.
- /build-fix
通过最小化、安全的改动,逐步修复构建(Build)和类型(Type)错误。
Open command - /checkpoint
在工作流(Workflow)中创建或验证检查点。
Open command - /claw
启动 NanoClaw 智能体 (Agent) REPL — 一个由 claude CLI 驱动的持久化、会话感知 (session-aware) 的 AI 助手。
Open command - /code-review
对未提交的更改进行全面的安全和质量审查:
Open command - /e2e
使用 Playwright 生成并运行端到端测试。创建测试旅程、运行测试、捕获截图/视频/追踪,并上传产物。
Open command - /evolve
分析直觉(Instincts)并建议或生成进化的结构
Open command

