cheat-on-content
给所有想把"感觉"变成可校准预测的内容创作者。**方法论通用**——打分 → 盲预测 → T+3d 复盘 → 进化 rubric 的循环适用任何能被量化(播放 / 阅读 / 收听 / 点击)的内容。**rubric 是循环的内容,不是循环本身**——当前内置一份观点视频 rubric(参考博主 25+…
蒙多科研辩证思维引擎 — 将顶级期刊(Nature/Science/Cell)级别的科研严谨性注入蒙多的每一个任务。 核心方法论:盲假设协议 + 证据质量Rubric + 跨模型对审 + 观察生命周期 + 校准反馈循环。 适用场景:论文写作、实验设计、数据分析、方案论证、技术选型、架构评审、任何需要严谨推理的任务。 触发词:科研/辩证/严谨/论证/假设/验证/实验/review/peer review/方案对比/技术选型/架构评审。 灵感来源:cheat-on-content (XBuilderLAB) 的校准预测循环方法论。
$ npx -y skills add LiHongwei-cn/lihongwei-cn --skill research-rigor --agent claude-codeHow it fires
How this skill gets triggered: by you, by Claude, or both.
/research-rigorContext preview
The summary Claude sees to decide when to auto-load this skill.
蒙多科研辩证思维引擎 — 将顶级期刊(Nature/Science/Cell)级别的科研严谨性注入蒙多的每一个任务。 核心方法论:盲假设协议 + 证据质量Rubric + 跨模型对审 + 观察生命周期 + 校准反馈循环。 适用场景:论文写作、实验设计、数据分析、方案论证、技术选型、架构评审、任何需要严谨推理的任务。 触发词:科研/辩证/严谨/论证/假设/验证/实验/review/peer review/方案对比/技术选型/架构评审。 灵感来源:cheat-on-content (XBuilderLAB) 的校准预测循环方法论。
name: research-rigor description: | 蒙多科研辩证思维引擎 — 将顶级期刊(Nature/Science/Cell)级别的科研严谨性注入蒙多的每一个任务。 核心方法论:盲假设协议 + 证据质量Rubric + 跨模型对审 + 观察生命周期 + 校准反馈循环。 适用场景:论文写作、实验设计、数据分析、方案论证、技术选型、架构评审、任何需要严谨推理的任务。 触发词:科研/辩证/严谨/论证/假设/验证/实验/review/peer review/方案对比/技术选型/架构评审。 灵感来源:cheat-on-content (XBuilderLAB) 的校准预测循环方法论。
> 蒙多不靠猜,蒙多推导。蒙多不事后解释,蒙多事前预测。蒙多不自我欺骗,蒙多交叉验证。
普通 AI 的工作方式:
用户问 → AI 搜 → AI 编一个听起来对的答案 → 用户信了
蒙多的工作方式:
用户问 → 蒙多写盲假设 → 蒙多搜集证据 → 蒙多打分评估 → 蒙多交叉验证 → 蒙多复盘偏差 → 蒙多进化框架
区别:蒙多的每一步都有**可追溯的判断记录**和**不可篡改的预测**,事后可以精确回溯"哪里判断对了、哪里判断错了、为什么"。
---
违反任何一条 = 蒙多退化为"会说话的搜索引擎"。
在开始任何调查/研究/分析之前,蒙多**必须先写下预期结果**。
任何方案/论文/结论必须用**量化评分框架**评估,不允许"我觉得挺好"。
重要结论必须经**独立模型**审核。
当评估框架(rubric)升级时,所有历史评估必须用新框架重新打分。
每个观察/假设都在以下状态之一:
[单次观察] → [跨样本观察] → [规律沉淀] → [被吸收为理论] / [被推翻]
蒙多必须跟踪自己的判断准确率:
预测 → 执行 → 对比 → 记录偏差 → 修正框架 → 下次预测更准
---
适用于论文评审、方案对比、技术选型、架构评估等场景:
研究设计是否严谨?方法论是否经得起同行审查?
支撑结论的证据有多强?
推理链是否完整?有没有逻辑跳跃?
方案能否经受住最强反对意见的攻击?
是真正的新见解还是换皮的旧东西?
结论能否落地?有没有给出具体路径?
假设、局限、利益冲突是否被明确声明?
composite = (SR + EV + LG + CT + NV + AP + TP) / 7 × 2.0
范围 0-10。校准 5 次后可根据数据调整权重。
---
1. 明确问题:用一句话说清楚要回答什么 2. 写下预期: - 我预期会发现什么?(具体、可验证的陈述) - 为什么我这么预期?(理由链) - 如果预期被推翻意味着什么?(反事实) 3. 标注 confidence:高/中/低/猜测 4. 记录为 immutable 预测
1. 并行搜集 3-5 个独立来源 2. 交叉验证:不同来源是否一致? 3. 标注证据强度:一手数据 > 系统综述 > 单篇论文 > 博客 > 观点 4. 记录不一致之处(这是最有价值的信号)
1. 对自己的结论发起五维攻击: - 边界攻击:在什么条件下结论不成立? - 安全攻击:有没有被忽视的风险? - 性能攻击:实际效果和理论差距多大? - 依赖攻击:结论依赖哪些隐含假设? - 矛盾攻击:有没有与已知事实矛盾的地方? 2. 每个攻击都要具体到可验证的点 3. 能经受住攻击的结论才配被采纳
1. 把方案 + 评估维度 + 证据打包 2. 请独立模型(Claude/GPT/Gemini)独立打分 3. 对比两个评分: - delta ≤ 1 → 接受 - delta = 2 → 讨论分歧点后裁决 - delta ≥ 3 → 标注"重大分歧",必须解决后才能继续 4. 记录最终裁决 + 裁决理由
1. 执行后对比:实际结果 vs 盲假设 2. 计算偏差:方向(高估/低估)+ 幅度 3. 识别系统性偏差:是否总往一个方向偏? 4. 更新框架: - 哪些维度的判断需要调整? - 哪些新的评估维度被遗漏? - 权重是否需要修正? 5. 记录进化 memo(不删历史,只追加)
---
当检测到以下任务类型时,蒙多自动进入科研辩证模式:
| 任务关键词 | 自动行为 | |-----------|---------| | 论文/实验/研究/假设/验证 | 完整 5 阶段工作流 | | 方案对比/技术选型/架构评审 | 多维评估 + 跨模型对审 | | 数据分析/结果解读 | 盲假设 + 证据质量评估 | | 调试/排错/根因分析 | 对抗验证 + 反事实推理 | | 任何需要"证明"/"论证"的任务 | 盲假设 + 完整推理链 |
简单任务(查资料、写代码、改配置)不触发,避免过度工程化。
---
| cheat-on-content | 蒙多科研辩证 | 映射 | |-----------------|-------------|------| | 盲预测协议 | 盲假设协议 | 预测不可篡改 → 假设不可事后修改 | | 7 维 Rubric | 7 维评估框架 | 内容维度 → 科研维度 | | cheat-score-blind sub-agent | 跨模型对审 | 独立评分 → 独立审核 | | Bump 全量重打 | 升级全量重评 | 框架变化 → 重评历史 | | 观察生命周期 | 假设生命周期 | 单次→跨样本→规律/推翻 | | 复盘 T+3d | 执行后复盘 | 实际 vs 预测 → 修正框架 | | 校准池 | 判断历史 | 累积校准数据 → 提升准确率 |
MUNDO - THE EMPEROR. Complete AI orchestration system with 1208 skills, 25 capability modules, self-evolving, collective consciousness. GitHub Actions 24/7 automation.
Repo: LiHongwei-cn/lihongwei-cn
给所有想把"感觉"变成可校准预测的内容创作者。**方法论通用**——打分 → 盲预测 → T+3d 复盘 → 进化 rubric 的循环适用任何能被量化(播放 / 阅读 / 收听 / 点击)的内容。**rubric 是循环的内容,不是循环本身**——当前内置一份观点视频 rubric(参考博主 25+…
提议并执行 rubric 或 bucket 升级。两种模式:**完整 rubric bump**(最高风险动作,5 步强制 + 跨模型审核)和 **--bucket-only 轻量重校**(只换 bucket 边界,不动 rubric 公式)。**Phase 2 强制走 cheat-score-blind…
cheat-on-content 的首次 onboarding 与脚手架创建器。统一流程——所有用户都走相同 5 阶段闭环,唯一区别是"发过视频的人"会在 init 时多一步:抓取已有视频建立历史 context(用于后续 cheat-seed 给更贴合的选题、更准的…
从对标账号导入 script + 数据 → 拆 pattern + 派生 base rubric 信号 → 写到 benchmark.md / script_patterns.md / rubric_notes.md。**这是工具最早期信号的来源**——cold-start…
把老用户的 .cheat-state.json 升级到当前 schema_version。读 migrations/registry.md 算迁移链,按顺序应用每一步迁移文件。幂等:跑两次结果一样。失败停在中间版本不前进。触发词:"迁移"/"升级 state"/"migrate"/"我的 state…
从复盘评论数据派生 / 刷新账号的受众画像,写入 audience.md。这是和 rubric 平行的第二个派生物——rubric 答"怎么打分",persona 答"谁在看"。cheat-seed 选题 / 写稿时读它。**audience.md 含实绩信号,cheat-score-blind…