中文

EcoGym:在交互式经济中评估大语言模型的长时程规划与执行

计算与语言 2026-05-12 v3 人工智能

摘要

长时程规划被广泛认为是自主基于大语言模型(LLM)的智能体的核心能力;然而,当前的评估框架大多存在情景化、领域特定或未能充分基于持久经济动态的问题。我们引入了EcoGym,一个用于在交互式经济中进行连续规划与执行决策的可泛化基准。EcoGym包含三个多样化的环境:Vending(改编自闭源的Vending-Bench,完全开源发布)、Freelance(新)和Operation(新),这些环境在统一的决策过程中实现,具有标准化接口,并在有效无限的时间范围(如果以365天循环评估,则超过1000步)内进行预算化行动。EcoGym的评估基于与业务相关的结果(例如,净资产、收入和日活跃用户数),旨在评估在部分可观测性和随机性下的长期战略连贯性和鲁棒性。在十一个领先的LLM上的实验揭示了一个系统性的矛盾:没有单一模型在所有三个场景中占据主导地位。关键的是,我们发现模型在高层策略或高效行动执行方面表现出显著的次优性。EcoGym作为一个开放、可扩展的测试平台发布,用于透明的长时程智能体评估以及研究经济环境中的可控性与效用权衡。

关键词

引用

@article{arxiv.2602.09514,
  title  = {EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies},
  author = {Xavier Hu and Jinxiang Xia and Shengze Xu and Kangqi Song and Yishuo Yuan and Guibin Zhang and JinCheng Ren and Boyu Feng and Li Lu and Tieyong Zeng and Jiaheng Liu and Minghao Liu and He Zhu and Yuchen Eleanor Jiang and Wei Wang and Wangchunshu Zhou},
  journal= {arXiv preprint arXiv:2602.09514},
  year   = {2026}
}

备注

update