中文

TextAtari:语言智能体进行 10 万帧游戏操控

计算与语言 2025-06-11 v2 人工智能 机器学习

摘要

我们提出了 TextAtari,一个用于评估语言智能体在长达 100,000 步的长时序决策任务上表现的基准。通过将经典 Atari 游戏的视觉状态表示转化为丰富的文本描述,TextAtari 创造了一个具有挑战性的测试平台,桥接了序贯决策与自然语言处理。该基准包含近 100 个具有不同复杂度、动作空间与规划范围的任务,均通过无监督表示学习框架(AtariARI)以文本形式呈现。我们评估了三个开源大语言模型(Qwen2.5-7B、Gemma-7B 和 Llama3.1-8B),涵盖三种智能体框架(零样本、少样本思维链和反思推理),以评估不同形式的先验知识在这些长时序挑战上的表现。四个场景——基础、遮挡、手动增强和基于参考——研究了语义理解、指令理解和专家示范对智能体决策的影响。我们的结果揭示了语言智能体与人类玩家在广泛规划任务上的显著表现差距,凸显了在数万步中进行序贯推理、状态追踪和战略规划方面的挑战。TextAtari 提供了标准化的评估协议、基线实现以及推动语言模型与规划交叉领域研究的框架。我们的代码可在 https://github.com/Lww007/Text-Atari-Agents 获取。

关键词

引用

@article{arxiv.2506.04098,
  title  = {TextAtari: 100K Frames Game Playing with Language Agents},
  author = {Wenhao Li and Wenwu Li and Chuyun Shen and Junjie Sheng and Zixiao Huang and Di Wu and Yun Hua and Wei Yin and Xiangfeng Wang and Hongyuan Zha and Bo Jin},
  journal= {arXiv preprint arXiv:2506.04098},
  year   = {2025}
}

备注

51 pages, 39 figures