中文

CivBench:用于评估 LLM 在文明 V 中战略决策的进度基准

人工智能 2026-04-10 v1

摘要

评估基于 LLM 的智能体在战略决策方面的能力,需要具备生成性、竞争性和纵向性的环境,但鲜有基准能提供这三者,更少的基准还不具备足以进行多智能体游戏的丰富评估信号。我们引入 CivBench,这是一个针对 multiplayer Civilization V 中 LLM 战略家 (即智能体设置) 的基准测试。由于在数百回合且涉及多个对手的游戏中,仅凭终局胜负信号稀疏不足以评估,我们训练模型基于回合级别的游戏状态估计整个游戏中胜利概率,并通过预测效度、建构效度和收敛效度进行验证。在 307 场包含 7 个 LLM 和多种 CivBench 智能体条件的游戏中,我们展示了 CivBench 作为一种未饱和基准的潜力,揭示了特定模型的智能体设置效应,并勾勒出不同于仅通过结果评估可见的战略轮廓。

关键词

引用

@article{arxiv.2604.07733,
  title  = {CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V},
  author = {John Chen and Sihan Cheng and Can Gurkan and Mingyi Lin},
  journal= {arXiv preprint arXiv:2604.07733},
  year   = {2026}
}

备注

Under review