中文

TowerMind:一个用于LLM智能体的塔防游戏学习环境与基准

人工智能 2026-05-27 v2

摘要

大型语言模型(LLM)的最新突破使其成为智能体的一种有前景的范式,长期规划和决策成为适应多样化场景和任务的核心通用能力。即时战略(RTS)游戏是评估这两种能力的理想测试平台,因为其固有的游戏玩法既需要宏观的战略规划,也需要微观的战术适应和行动执行。现有的基于RTS游戏的环境要么计算需求相对较高,要么缺乏对文本观察的支持,这限制了RTS游戏在LLM评估中的应用。受此启发,我们提出了TowerMind,这是一个基于RTS游戏子类型塔防(TD)的新颖环境。TowerMind保留了RTS游戏在评估LLM方面的关键优势,同时具有低计算需求和多模态观察空间,包括基于像素的、文本的和结构化的游戏状态表示。此外,TowerMind支持对模型幻觉的评估,并提供了高度的可定制性。我们设计了五个基准关卡,以评估几种广泛使用的LLM在不同多模态输入设置下的表现。结果揭示了LLM与人类专家在能力和幻觉维度上的明显性能差距。实验进一步凸显了LLM行为的关键局限性,例如规划验证不足、决策缺乏多终局性以及行动使用效率低下。我们还评估了两种经典的强化学习算法:Ape-X DQN和PPO。通过提供轻量级和多模态的设计,TowerMind补充了现有的基于RTS游戏的环境格局,并为AI智能体领域引入了一个新的基准。源代码已在GitHub上公开(https://github.com/tb6147877/TowerMind)。

关键词

引用

@article{arxiv.2601.05899,
  title  = {TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents},
  author = {Dawei Wang and Chengming Zhou and Di Zhao and Xinyuan Liu and Marci Chi Ma and Gary Ushaw and Richard Davison},
  journal= {arXiv preprint arXiv:2601.05899},
  year   = {2026}
}

备注

AAAI 2026 Oral