中文

BeTAIL:基于人类赛车游戏的行为 Transformer 对抗性模仿学习

机器学习 2024-07-12 v2 机器人学

摘要

模仿学习从演示中学习策略,而无需手工设计的奖励函数。在许多机器人任务(如自主赛车)中,被模仿的策略必须模拟复杂的环境动态和人类决策。序列建模在捕捉运动序列的复杂模式方面非常有效,但难以适应新环境或现实世界机器人任务中常见的分布偏移。相比之下,对抗性模仿学习 (AIL) 可以缓解这种影响,但在样本效率和处理复杂运动模式方面存在困难。因此,我们提出了 BeTAIL:行为 Transformer 对抗性模仿学习,它将来自人类演示的行为 Transformer (BeT) 策略与在线 AIL 相结合。BeTAIL 在 BeT 策略上添加了一个 AIL 残差策略,以模拟人类专家的序列决策过程,并修正分布外状态或环境动态的偏移。我们在 Gran Turismo Sport 中具有专家级真实人类游戏演示的三个挑战上测试了 BeTAIL。我们提出的残差 BeTAIL 减少了环境交互,提高了赛车性能和稳定性,即使 BeT 是在与下游学习不同的赛道上预训练的。视频和代码地址:https://sites.google.com/berkeley.edu/BeTAIL/home。

关键词

引用

@article{arxiv.2402.14194,
  title  = {BeTAIL: Behavior Transformer Adversarial Imitation Learning from Human Racing Gameplay},
  author = {Catherine Weaver and Chen Tang and Ce Hao and Kenta Kawamoto and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2402.14194},
  year   = {2024}
}

备注

Preprint