中文

Game-TARS:面向可扩展通用多模态游戏智能体的预训练基础模型

人工智能 2025-10-29 v1

摘要

我们提出Game-TARS,这是一个以人类对齐的原生键盘-鼠标输入为锚点的统一、可扩展动作空间的通用游戏智能体。不同于API或GUI方法,此范式使大规模持续预训练跨异构域成为可能,包括操作系统、网页和模拟游戏。Game-TARS在5000亿以上令牌的多样化轨迹和多模态数据上进行预训练。关键技术包括减少因果混淆的衰减式持续损失和在推理深度与推理成本之间取得平衡的高效稀疏思考策略。实验表明,Game-TARS在开放世界Minecraft任务上的成功率约为前SOTA模型的2倍,在未遇见的网页3D游戏中接近新鲜人类的通用性,在FPS基准测试中超越GPT-5、Gemini-2.5-Pro和Claude-4-Sonnet。训练时间和测试时间的扩展结果确认,统一动作空间在跨游戏和多模态数据扩展时仍能保持改进。我们的结果表明,简单、可扩展的动作表示与大规模预训练为通用具备广泛计算机使用能力的智能体提供了可行的路径。

关键词

引用

@article{arxiv.2510.23691,
  title  = {Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents},
  author = {Zihao Wang and Xujing Li and Yining Ye and Junjie Fang and Haoming Wang and Longxiang Liu and Shihao Liang and Junting Lu and Zhiyong Wu and Jiazhan Feng and Wanjun Zhong and Zili Li and Yu Wang and Yu Miao and Bo Zhou and Yuanfan Li and Hao Wang and Zhongkai Zhao and Faming Wu and Zhengxuan Jiang and Weihao Tan and Heyuan Yao and Shi Yan and Xiangyang Li and Yitao Liang and Yujia Qin and Guang Shi},
  journal= {arXiv preprint arXiv:2510.23691},
  year   = {2025}
}