中文

学习游戏玩法:面向3D游戏的多模态智能体

代数几何 2025-10-21 v1

摘要

我们认为3D第一人称视频游戏是实时多模态推理的挑战性环境。我们首先描述了我们的数据集,跨越大量3D第一人称游戏,规模更大、更具多样性,并且包含文本指令。我们展示了可以从该数据集中学习逆向动力学模型,该模型允许我们对大量缺乏记录动作的公开人类游戏视频进行动作推断。随后我们使用行为模仿训练一个文本条件智能体进行游戏玩法,采用能够在消费级GPU上实时推理的定制架构。我们展示所得模型能够玩各种3D游戏并响应文本输入。最后,我们概述了一些剩余挑战,如长期任务和在大量游戏中进行的定量评估。

关键词

引用

@article{arxiv.2510.16773,
  title  = {On the arithmetic of rational hypersurfaces in toric varieties},
  author = {Gianluca Grassi},
  journal= {arXiv preprint arXiv:2510.16773},
  year   = {2025}
}