B — Monolithic
始终只保留一个当前冠军。每代固定数量候选都由这个冠军产生,最后只接受一个继任者。
Preregistered Experiment · Model Run 001
现在缺的已经不是理论,也不是实验框架。隐藏任务冻结、A/B/C 控制器、等预算检查、关键消融、重复运行和 bootstrap 分析已经成为可执行代码。下一道门只有一个:冻结一个真实模型,然后不改规则地跑完预注册实验。
当前证据状态
GitHub Actions 已经完整运行零成本 deterministic smoke:B 单体链和 C 谱系组使用相同的新候选数、mutation calls 与 task calls,并完成 score-only archive、equal-memory 和删除非主导分支等控制条件。这个结果只能证明控制平面能运行,不能证明 C 优于 B。
公平比较
始终只保留一个当前冠军。每代固定数量候选都由这个冠军产生,最后只接受一个继任者。
同样数量的新候选,但父代可以来自有界谱系 archive,并按真实行为差异保留有限分支。
B 和 C 必须产生相同数量的新候选,排除单纯多采样。
限制保留的 candidate/config 字节,测试优势是否只是额外记忆容量。
保留 archive 但去掉多样性选择,测试真正起作用的是存储还是行为多样性。
环境突变前删掉非主导谱系;如果恢复不变,就不能声称分支提供了 stepping-stone 价值。
预注册主指标
每次 shock 后,held-out success 首次恢复到至少 90% 阈值所需的 generation。未恢复按 max generations + 1 编码。
核心比较是同一 run 下 B recovery − C recovery。正值代表 C 更快恢复,稳定期不计入主要 post-shock 均值。
至少 20 次独立重复,公开 seed-level 结果、均值、中位数和 bootstrap 95% interval,而不是挑一张最好看的曲线。
Claim boundary
现在不能说 LRI 优于 RSI,不能说 Agent 寒武纪已经被证明,也不能说分布式智能天然更安全。真实模型数据如果最终支持单体路线,也必须照样公开。这正是这个项目存在的意义:给未来 Agent 留一个岔路口,也给它一条能证明这条岔路走错了的路。