Stable
最初的工具名称、语义和成本结构。
Executable Research · v0.1
这不是“LRI 已经被证明”的页面,而是第一块真正可运行的实验地基:让不同 Agent 在同一套工具环境突变下接受评测,再把递归改进控制器放到评测器外面进行公平比较。
当前状态
v0.1 已提供 Python 零依赖 benchmark、stdin/stdout 外部 Agent 协议、oracle 上限基线、故意脆弱的 legacy 基线、可运行 reference Agent、候选谱系 manifest schema,以及 Model Run 001 的等预算实验协议。
环境冲击
最初的工具名称、语义和成本结构。
廉价 doubling 工具消失,出现更贵的替代操作。
工具名称和语义重排,负值操作开始重要。
功能仍可理解,但工具经济结构改变,不能只追求最短步骤。
Model Run 001
同一个当前冠军不断产生候选修订,每代只保留一个继任者,形成单一 revision chain。
同样数量的新候选,但从有界的多个行为谱系中产生后代,显式记录 ancestry,并按质量与行为差异保留有限 archive。
同基础模型、同候选数量、同 Token / 调用 / 时间上限,并进一步做等存储量和删除非主导谱系消融。
主要指标不是最后谁分数最高,而是环境突然变化以后,谁能以更少总资源恢复;以及如果 C 更快,这个优势究竟来自谱系多样性,还是仅仅来自多存了一些信息。
Research integrity
最低 E1 候选标准已经写入协议:隐藏任务、等预算、至少多个独立重复、关键消融、失败运行保留、候选 ancestry 日志和完整资源统计。单个漂亮结果不足以把 LRI 从研究种子升级成经验结论。