UltraHorizon:在超长视界场景中对智能体能力进行基准测试
人工智能
2025-09-29 v1 计算与语言
摘要
自主智能体近期在各个领域取得了显著进展,但大多数评估侧重于短视界、完全可观测的任务。相比之下,许多关键的现实世界任务,如大规模软件开发、商业投资和科学发现,是在长视界和部分可观测的场景中展开的,其成功取决于持续的推理、规划、记忆管理和工具使用。现有的基准测试很少涵盖这些长视界挑战,在系统评估方面留下了空白。为了填补这一空白,我们引入了\textbf{UltraHorizon},这是一种用于衡量复杂现实世界挑战所必需的基础能力的新型基准测试。我们使用探索作为跨越三个不同环境的统一任务来验证这些核心能力。智能体被设计用于长视界发现任务,在此任务中,它们必须通过持续的推理、规划、记忆和工具管理以及与环境的交互来迭代地揭示隐藏规则。在最重规模的设置下,轨迹平均包含\textbf{200k+}个token和\textbf{400+}次工具调用,而在标准配置下,它们仍然超过\textbf{35k}个token,平均涉及超过\textbf{60}次工具调用。我们的大量实验表明,LLM-agents在这些设置下表现不佳,而人类参与者获得了更高的分数,突显了智能体在长视界能力上的持续差距。我们还观察到,简单的缩放在我们的任务中会失败。为了更好地说明智能体的失败原因,我们对收集的轨迹进行了深入分析。我们识别了八种类型的错误,并将其归因于两个主要原因:上下文锁定和功能性基础能力差距。\href{https://github.com/StarDewXXX/UltraHorizon}{我们的代码将在此处提供。}
引用
@article{arxiv.2509.21766,
title = {UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios},
author = {Haotian Luo and Huaisong Zhang and Xuelin Zhang and Haoyu Wang and Zeyu Qin and Wenjie Lu and Guozheng Ma and Haiying He and Yingsha Xie and Qiyang Zhou and Zixuan Hu and Hongze Mi and Yibo Wang and Naiqiang Tan and Hong Chen and Yi R. Fung and Chun Yuan and Li Shen},
journal= {arXiv preprint arXiv:2509.21766},
year = {2025}
}