中文

SS-MAIL:自监督多智能体模仿学习

人工智能 2021-10-19 v1

摘要

当前多智能体专家模仿领域主要由两类算法主导——行为克隆和对抗模仿学习。BC 方法会产生复合误差,因为它们忽略了轨迹生成问题的序贯决策特性。此外,它们无法有效地对多模态行为进行建模。虽然 AIL 方法解决了复合误差和多模态策略训练的问题,但其训练动态存在不稳定性。在这项工作中,我们通过引入一种新颖的自监督损失来解决这一问题,该损失鼓励判别器逼近更丰富的奖励函数。我们采用我们的方法训练了一个基于图的多智能体 actor-critic 架构,该架构学习一个以习得的潜在交互图为中心的集中式策略。我们表明,我们的方法(SS-MAIL)在真实世界预测任务以及专门设计的合成实验中均优于先前的 SOTA 方法。我们通过提供与成本正则化学徒学习的理论联系,证明了 SS-MAIL 属于 AIL 方法家族。此外,我们利用自监督公式化引入了一种新颖的基于教师强制的课程(轨迹强制),该课程通过逐步增加生成轨迹的长度来提高样本效率。SS-MAIL 框架通过稳定策略训练、改善奖励塑造能力以及提供对多模态轨迹建模的能力,提升了多智能体模仿能力。

关键词

引用

@article{arxiv.2110.08963,
  title  = {SS-MAIL: Self-Supervised Multi-Agent Imitation Learning},
  author = {Akshay Dharmavaram and Tejus Gupta and Jiachen Li and Katia P. Sycara},
  journal= {arXiv preprint arXiv:2110.08963},
  year   = {2021}
}

备注

Pre-Print