中文

BehAVE:视频游戏编码的行为对齐

计算机视觉与模式识别 2024-11-04 v3 人工智能

摘要

领域随机化增强了视觉模型在视觉上不同但内容相似的领域之间的可迁移性。然而,当前的方法严重依赖于复杂的模拟引擎,阻碍了可行性和可扩展性。本文介绍了BehAVE,这是一个视频理解框架,它利用现有的商业视频游戏进行领域随机化,而无需访问其模拟引擎。BehAVE利用视频游戏的视觉多样性进行随机化,并使用玩家动作的文本描述来对齐具有相似内容的视频。我们使用各种视频和文本基础模型,在25款第一人称射击(FPS)游戏中评估了BehAVE,证明了其在领域随机化方面的鲁棒性。BehAVE有效地对齐了玩家行为模式,并在仅在一款游戏上训练时,实现了对多款未见过的FPS游戏的零样本迁移。在一个更具挑战性的场景中,即使在一款不同类型游戏上训练,BehAVE也能将基础模型的零样本可迁移性提升至未见过的FPS游戏,提升幅度高达22%。BehAVE可在 https://github.com/nrasajski/BehAVE 在线获取。

关键词

引用

@article{arxiv.2402.01335,
  title  = {BehAVE: Behaviour Alignment of Video Game Encodings},
  author = {Nemanja Rašajski and Chintan Trivedi and Konstantinos Makantasis and Antonios Liapis and Georgios N. Yannakakis},
  journal= {arXiv preprint arXiv:2402.01335},
  year   = {2024}
}