基于监督对比模仿学习的视频游戏智能体表征学习
人工智能
2025-09-16 v1 机器学习
摘要
本文介绍了一种将监督对比学习(SupCon)应用于模仿学习(IL)的新方法,专注于学习视频游戏环境中智能体的更有效状态表征。目标是获取能够更好捕捉动作相关因素的观察表征,从而更好地建模从观察到演示者执行的动作之间的因果关系,例如,当障碍物出现在前方时玩家会跳跃。我们提出的方法将SupCon损失与连续输出空间集成,使SupCon能够在无需对环境动作类型限制的前提下运行。在Astro Bot和Returnal等3D游戏以及多个2D Atari游戏上的实验表明,与仅使用监督动作预测损失函数训练的基线模型相比,所提方法在表征质量、学习收敛速度和泛化能力方面均取得改进。
引用
@article{arxiv.2509.11880,
title = {Learning Representations in Video Game Agents with Supervised Contrastive Imitation Learning},
author = {Carlos Celemin and Joseph Brennan and Pierluigi Vito Amadori and Tim Bradley},
journal= {arXiv preprint arXiv:2509.11880},
year = {2025}
}