Long-Horizon-Terminal-Bench:在具有密集奖励评分的长期终端任务上测试智能体的极限
人工智能
2026-07-09 v1
摘要
AI智能体已经能够自主完成简短、定义明确的任务。然而,现有的终端基准测试主要关注在几分钟内完成并通过最终结果进行评估的简单问题。这种设置忽略了中间进展和部分解决方案,导致奖励信号稀疏,对智能体能力的描绘不完整。我们引入了Long-Horizon-Terminal-Bench,一个包含46个长期任务的终端基准测试,涵盖九个类别,包括实验复现、软件工程、多模态分析、交互式游戏和科学计算。每个任务都遵循Terminal-Bench风格的设置,带有参考解决方案或模拟引擎,但进一步分解为细粒度的分级子任务。这种设计实现了密集的中间奖励和部分学分,使评估不仅能够捕捉智能体是否达到最终目标,还能捕捉其在开放式工作流程中取得了多大进展。Long-Horizon-Terminal-Bench中的任务通常需要数百个回合和几分钟到几小时的执行时间,强调长期规划、长上下文管理和迭代调试,而不是一次性解决问题。我们评估了15个前沿模型,发现智能体平均每个任务消耗990万token,每次运行大约231个回合和85.3分钟的执行时间,这使得Long-Horizon-Terminal-Bench比之前的终端基准测试要求更高。即使是最强的测试模型,在部分奖励阈值为0.95时也仅达到15.2%的pass@1,在完美奖励阈值为1.0时达到10.9%,而所有模型在这两个阈值下的平均通过率分别为4.3%和1.7%。这些结果揭示了改进的空间。我们进一步分析了失败模式和错误模式,并发布了Long-Horizon-Terminal-Bench以支持未来在长期终端智能体方面的进展。
引用
@article{arxiv.2607.08964,
title = {Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading},
author = {Zongxia Li and Zhongzhi Li and Yucheng Shi and Ruhan Wang and Junyao Yang and Zhichao Liu and Xiyang Wu and Anhao Li and Yue Yu and Ninghao Liu and Lichao Sun and Haotao Mi and LeoweiLiang},
journal= {arXiv preprint arXiv:2607.08964},
year = {2026}
}
备注
17 pages