Rollout 卡片:智能体研究的可重复性标准
人工智能
2026-05-13 v1
摘要
长期以来,机器学习和强化学习都面临可重复性问题,如今正在在智能体研究中显现:论文通过报告的分数进行比较,却将评估记录留在这些分数之后难以检查。在智能体任务中,这尤为重要,因为同一行为在评估选择 rollout 的不同部分或应用不同报告规则时,可能获得不同的报告分数。在对50个热门训练和评估存储库进行结构审计后,我们发现没有一项报告说明失败、出错或被跳过的运行次数,以及 headline 分数。我们还记录了37个报告规则可改变任务成功率、cost/token 会计或计时测量的案例,这些情况有时会在固定证据下产生显著变化。我们将 rollout 记录而非报告分数视为智能体研究的可重复性单位。我们引入 rollout 卡片:包含 rollout 记录的出版捆绑品,并声明背后报告分数所使用的视图、报告规则和 drops 清单。我们在两个设置中验证了 rollout 卡片:首先,四个部分公开发布的案例(工具安全、多智能体系统、定理证明和搜索)让我们计算出原报告未包含的分析;其次,对保存的基准输出进行重新评分,显示仅改变报告规则即可使报告分数改变20.9个绝对百分点,并且在某些情况下会反转前沿模型的排名。我们发布了一个集成到 Ergon(开源强化学习训练营)中的参考实现,并公开发布了Ergon生成的 rollout 卡片导出文件,用于涵盖工具使用、软件工程、网页交互、多智能体协调、安全和搜索等基准测试,以支持未来研究。
关键词
引用
@article{arxiv.2605.12131,
title = {Rollout Cards: A Reproducibility Standard for Agent Research},
author = {Charlie Masters and Ziyuan Liu and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2605.12131},
year = {2026}
}