中文

扩展行为克隆提升因果推理:面向实时电子游戏游玩的开放模型

人工智能 2026-01-30 v2

摘要

随着模型和数据规模扩展所展现出的强大性能,行为克隆迎来了复兴。在本工作中,我们引入了一个开放的方法方案,用于训练旨在消费级 GPU 上进行实时推理的电子游戏游玩基础模型。我们在开放许可下发布了所有数据(8300 多小时高质量人类游玩记录)、训练和推理代码以及预训练检查点。在实验中,我们展示了我们最佳的模型在各种 3D 游戏中取得了与人类玩家相媲美的性能。我们使用该方法方案研究行为克隆的缩放定律,重点关注因果推理。在一个受控的玩具环境中,我们首先证明增加训练数据和网络深度使得模型学习到更具因果性的策略。随后我们在大规模上验证这些发现,分析了参数量高达 12 亿的模型。我们观察到,在玩具领域中看到的因果改进随模型大小和训练步数的增加依然成立。

关键词

引用

@article{arxiv.2601.04575,
  title  = {Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing},
  author = {Yuguang Yue and Irakli Salia and Samuel Hunt and Chris Green and Wenzhe Shi and Jonathan J Hunt},
  journal= {arXiv preprint arXiv:2601.04575},
  year   = {2026}
}

备注

27 pages, 16 figures