Gaia2:动态异步环境下 LLM 代理的基准测试
人工智能
2026-02-13 v1
摘要
我们引入 Gaia2,一个用于评估大型语言模型代理在真实、异步环境中的基准测试。与先前的静态或同步评估不同,Gaia2 引入环境独立于代理行为自身演化的情景,要求代理在时序约束下运行,适应噪声和动态事件,解决歧义,并与其他代理协作。每个情景配备 write-action 验证器,实现细粒度、行动层面的评估,使 Gaia2 可直接用于强化学习可验证奖励。我们对最新专有和开源模型进行评估,发现没有模型在所有能力上都占据统治地位:GPT-5(高)以 42% pass@1 的最强总体得分取得优势,但在时间敏感任务中表现不足,Claude-4 Sonnet 在准确率和速度之间进行权衡以降低成本,Kimi-K2 在开源模型中以 21% pass@1 领先。这些结果凸显了推理、效率、鲁棒性之间的根本性权衡,并暴露了在缩小“sim2real”鸿沟方面的挑战。Gaia2 基于消费级环境构建,采用开源 Agents Research Environments 平台,旨在易于扩展。我们随 Gaia2 及其基础 ARE 框架一起发布,以期为社区提供灵活的基础设施,用于开发、基准测试和训练下一代实用代理系统。
引用
@article{arxiv.2602.11964,
title = {Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments},
author = {Romain Froger and Pierre Andrews and Matteo Bettini and Amar Budhiraja and Ricardo Silveira Cabral and Virginie Do and Emilien Garreau and Jean-Baptiste Gaya and Hugo Laurençon and Maxime Lecanu and Kunal Malkan and Dheeraj Mekala and Pierre Ménard and Gerard Moreno-Torres Bertran and Ulyana Piterbarg and Mikhail Plekhanov and Mathieu Rita and Andrey Rusakov and Vladislav Vorotilov and Mengjue Wang and Ian Yu and Amine Benhalloum and Grégoire Mialon and Thomas Scialom},
journal= {arXiv preprint arXiv:2602.11964},
year = {2026}
}
备注
Accepted as Oral at ICLR 2026