中文

FutureSim:用于评估自适应 agent 的世界事件重放

机器学习 2026-05-15 v1 人工智能 计算与语言

摘要

AI agent 正在越来越多地部署在需要适应新信息的动态、开放式环境中。为了高效衡量这种能力以满足现实用例,我们提出构建基于真实世界事件顺序的仿真环境进行重放。我们构建了 FutureSim,agent 在其知识截止日期之后预测世界事件,同时与时间线回放互动:真实新闻文章陆续到达,问题得出。我们在 agent 的本机框架中对其进行评估,测试其在 2026 年 1 月至 3 月的三个月时间段内预测世界事件的能力。FutureSim 揭示了其能力之间存在明显的分离,最佳 agent 的准确率为 25%,许多 agent 的 Brier 技能得分甚至低于毫无预测。通过仔细的消融实验,我们表明 FutureSim 提供了一个现实的设置,用于研究诸如长期跨时段测试时适应、搜索、记忆和不确定性推理等新兴的研究方向。总体而言,我们希望本基准设计为在真实世界中跨越长时间范围的开放式适应测量 AI 进展之路。

关键词

引用

@article{arxiv.2605.15188,
  title  = {FutureSim: Replaying World Events to Evaluate Adaptive Agents},
  author = {Shashwat Goel and Nikhil Chandak and Arvindh Arun and Ameya Prabhu and Steffen Staab and Moritz Hardt and Maksym Andriushchenko and Jonas Geiping},
  journal= {arXiv preprint arXiv:2605.15188},
  year   = {2026}
}

备注

31 pages, 10 main