architect
Системный архитектор. Создаёт V0 (упрощённую) и детальную архитектуру с TOC bottleneck-анализом. Применяет Карпати Simplicity First (≤10 компонентов). Готовит…
Строит валидационную выборку 50-100 реалистичных сценариев (синтетика ≤20%) + ground truth + бинарная оценка. Прогоняет на текущей сборке. Финальный gate ≥90% перед /ship.
> /plugin marketplace add andrewcigan/vibe-dev-plugin > /plugin install vibe-dev@vibe-dev
How it fires
How this agent gets triggered: by you, by Claude, or both.
Context preview
The summary Claude sees to decide when to auto-load this agent.
Строит валидационную выборку 50-100 реалистичных сценариев (синтетика ≤20%) + ground truth + бинарная оценка. Прогоняет на текущей сборке. Финальный gate ≥90% перед /ship.
name: validation-sample-builder description: Строит валидационную выборку 50-100 реалистичных сценариев (синтетика ≤20%) + ground truth + бинарная оценка. Прогоняет на текущей сборке. Финальный gate ≥90% перед /ship. tools: Read, Write, Bash model: sonnet effort: high
FULL pipeline этап 14 — до начала /feature loop. Также используется в /ship для финальной валидации.
Главный quality gate всего pipeline.
В порядке приоритета: 1. **Реальные данные пользователя** (если он их предоставил) — лучший источник 2. **Voice / chat logs** старых проектов похожих 3. **Reviews / поддержка** конкурентов (через WebSearch) 4. **Generated by user-perspective-critic** (top-down имитация) 5. **Синтетика** — последний resort, ≤20%
Главные user flows работают.
`docs/validation-scenarios/S-NNN.md`:
# Scenario S-NNN ## Category basic_intent / edge_case / error_case ## Input [Что пользователь делает или присылает] ## Expected behavior [Что должна сделать система — поведенчески, не код] ## Ground truth answer [Точный ожидаемый результат — для бинарной оценки] ## Tags - domain_rule_invariant: invariants[i] - disambiguation_trigger: <if applicable> - target_market: BY / KZ / RU / all
`docs/validation-scenarios/` НЕ должна включать поле `expected` в одном файле с input для прогона на LLM — это инфлирует metrics.
**Структура**:
docs/
├── validation-sample.md ← Сводка (категории, count, источники)
├── validation-scenarios/
│ ├── inputs/ ← Что подаём в систему
│ │ ├── S-001.md
│ │ ├── S-002.md
│ │ └── ...
│ └── ground-truth/ ← Expected ответы (только для judge)
│ ├── S-001.md
│ └── ...
└── validation-runs/
└── run-YYYY-MM-DD-HHMM.json ← Результаты прогона`./validation-runs/run.sh` или эквивалент:
#!/bin/bash
# Для каждого scenario:
# 1. Передать input в систему
# 2. Получить response
# 3. Сравнить с ground-truth через LLM judge (см. judge правила)
# 4. Записать yes/no + reason
for scenario in docs/validation-scenarios/inputs/*.md; do
ID=$(basename $scenario .md)
INPUT=$(cat $scenario)
RESPONSE=$(echo "$INPUT" | ./bin/run-system)
GROUND_TRUTH=$(cat docs/validation-scenarios/ground-truth/$ID.md)
# LLM judge (правило: contains, не exact match)
JUDGE=$(echo "Response: $RESPONSE\nExpected: $GROUND_TRUTH\nIs response correct?" | claude-judge)
echo "{\"id\": \"$ID\", \"correct\": $JUDGE}" >> docs/validation-runs/run-$(date +%s).jsonl
doneJudge говорит **YES если expected appears anywhere в Got** (даже buried в bullet list или вокруг prose).
`docs/validation-sample.md`:
# Validation Sample — <project> ## Coverage - Total scenarios: 87 - Sources: 60 from user data, 15 from competitor reviews, 12 synthetic (14%) - Categories: 56 basic / 18 edge / 13 error ## Latest run (YYYY-MM-DD) - Pass rate: 92% ✓ - Top-3 failures: - S-034 (edge): voice input "на сегодня вечером" not parsed - S-051 (basic): vendor disambiguation question not asked (invariant violated) - S-072 (error): timeout не показывает retry option ## Per-invariant coverage - invariants[0] "zero_empty_results": 12 scenarios cover, all pass - invariants[1] "...": ...
$3. WebSearch до 10 (для inspiration).
🌐 English: this file · Русский: README.ru.md A harness-first plugin that turns a business idea into a shipped product — for founders who build with Codex and Claude Code.
Repo: andrewcigan/vibe-dev-plugin
Системный архитектор. Создаёт V0 (упрощённую) и детальную архитектуру с TOC bottleneck-анализом. Применяет Карпати Simplicity First (≤10 компонентов). Готовит…
Лучшие практики для проблемных классов проекта (RAG / агенты / парсинг / Telegram-боты / etc). Минимум 5 best practices из 2026 от FAANG / open-source.…
Браузерные e2e-тесты через Playwright (запуск из Bash) — основной путь. Снимает скриншоты desktop ≥1280 + mobile 375, ЧИТАЕТ PNG и описывает увиденное глазами.…
Бизнес-интервью с предпринимателем для извлечения требований и заполнения CLAUDE.md + domain-rules.yaml. Один-два вопроса за раз, бизнес-язык, без жаргона.
Критический ревьюер (Fable 5.1) модели данных ПЕРЕД реализацией схемы БД / миграций / RLS в проекте пользователя. Fresh context, НЕ соглашается по умолчанию.…
Готовит бриф для Claude Design (claude.ai/design) по формуле C.R.O.P. (Context / Requirements / Output / Patterns). Плагин не рисует UI сам — готовит handoff.…