现代电子游戏中数据高效模仿学习的视觉编码器
机器学习
2025-07-01 v3 人工智能
计算机视觉与模式识别
摘要
电子游戏一直为决策社区提供有用的基准,但对于绝大多数研究社区而言,超越 Atari 游戏转向现代游戏是极其昂贵的。现代电子游戏中的先前工作通常依赖于特定于游戏的集成来获取游戏特征并实现在线训练,或依赖于现有的大型数据集。另一种方法是使用模仿学习训练智能体,纯粹从图像来玩电子游戏。然而,这种设置提出了一个基本问题:哪些视觉编码器能够获得保留对决策至关重要的信息的表示?为了回答这个问题,我们在 Minecraft、Counter-Strike: Global Offensive 和 Minecraft Dungeons 中,对使用公开可用的预训练视觉编码器的模仿学习与典型的特定于任务的端到端训练方法进行了系统比较研究。我们的结果表明,在分辨率相对较低的图像和仅需几分钟演示的情况下,端到端训练即可生效,但根据游戏的不同,利用 DINOv2 等预训练编码器可以获得显著的性能提升。除了能够实现有效的决策外,我们还表明,预训练编码器可以通过显著降低训练成本,使电子游戏中的决策研究更易于开展。
引用
@article{arxiv.2312.02312,
title = {Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games},
author = {Lukas Schäfer and Logan Jones and Anssi Kanervisto and Yuhan Cao and Tabish Rashid and Raluca Georgescu and Dave Bignell and Siddhartha Sen and Andrea Treviño Gavito and Sam Devlin},
journal= {arXiv preprint arXiv:2312.02312},
year = {2025}
}
备注
Camera-ready paper presented at the Adaptive and Learning Agents Workshop at the AAMAS 2025 conference