中文

智能体能力层级:在现实 RL 环境中评估前沿模型

人工智能 2026-01-15 v1

摘要

大型语言模型(LLM)基于智能体的发展已将 AI 评估从单轮响应评估转向交互式环境中的多步骤任务完成。我们 presented 对前沿 AI 模型在 Surge 公司提供的现实电商 RL 环境中 150 个职场任务上的 empirical 研究。我们的分析揭示了一个经验推导的\emph{智能体能力层级},模型必须掌握以进行实际部署:(1)工具使用,(2)规划与目标形成,(3)适应性,(4)扎实性,和(5)常识推理。即使是表现最佳的模型,也会在约 40% 的任务中失败,失败在该层级中可预测地聚集。较弱的模型在基本工具使用和规划方面困难重重,而较强的模型主要在需要超出明确指令的情境推理的任务中失败。我们引入一种以任务为中心的 RL 环境设计方法,强调多样性和领域专家贡献,提供详细的失败分析,并讨论了对智能体发展的意义。我们的发现表明,虽然当前的前沿模型可以展示连贯的多步骤行为,但在实现现实职场环境中的人类水平任务完成方面仍存在显著的能力差距。

关键词

引用

@article{arxiv.2601.09032,
  title  = {The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments},
  author = {Logan Ritchie and Sushant Mehta and Nick Heiner and Mason Yu and Edwin Chen},
  journal= {arXiv preprint arXiv:2601.09032},
  year   = {2026}
}