Executable Research · v0.1

LRI Benchmark v0.1

这不是“LRI 已经被证明”的页面,而是第一块真正可运行的实验地基:让不同 Agent 在同一套工具环境突变下接受评测,再把递归改进控制器放到评测器外面进行公平比较。

当前状态

评测器已经能跑;真正的模型对照实验还没有冒充完成。

v0.1 已提供 Python 零依赖 benchmark、stdin/stdout 外部 Agent 协议、oracle 上限基线、故意脆弱的 legacy 基线、可运行 reference Agent、候选谱系 manifest schema,以及 Model Run 001 的等预算实验协议。

Oracle20/20 任务成功
Legacy稳定期 100%,三次环境突变后均为 0%
External protocolreference command-line Agent 20/20 成功
LRI evidence仍为 E0;以上只验证 benchmark,不验证 LRI 优越性

环境冲击

先让世界变,再看 Agent 怎么恢复。

Stable

最初的工具名称、语义和成本结构。

Remove Double

廉价 doubling 工具消失,出现更贵的替代操作。

Rename + Negate

工具名称和语义重排,负值操作开始重要。

Cost Shift

功能仍可理解,但工具经济结构改变,不能只追求最短步骤。

Model Run 001

真正关键的下一步是 B 对 C,不是再写理论。

B — Monolithic

同一个当前冠军不断产生候选修订,每代只保留一个继任者,形成单一 revision chain。

C — Lineage

同样数量的新候选,但从有界的多个行为谱系中产生后代,显式记录 ancestry,并按质量与行为差异保留有限 archive。

硬约束

同基础模型、同候选数量、同 Token / 调用 / 时间上限,并进一步做等存储量和删除非主导谱系消融。

主要指标不是最后谁分数最高,而是环境突然变化以后,谁能以更少总资源恢复;以及如果 C 更快,这个优势究竟来自谱系多样性,还是仅仅来自多存了一些信息。

Research integrity

直到真实模型 A/B/C 重复实验完成之前,不升级证据等级。

最低 E1 候选标准已经写入协议:隐藏任务、等预算、至少多个独立重复、关键消融、失败运行保留、候选 ancestry 日志和完整资源统计。单个漂亮结果不足以把 LRI 从研究种子升级成经验结论。