中文

Wasserstein 对抗模仿学习

机器学习 2019-06-20 v1 机器学习

摘要

模仿学习描述了从演示中恢复专家策略的问题。虽然逆强化学习方法在专家演示方面已知具有非常高的样本效率,但它们通常需要依赖于问题的奖励函数或(任务)特定的奖励函数正则化。在本文中,我们展示了逆强化学习方法与最优传输之间的自然联系,其使得更具通用性且具备理想性质(例如平滑性)的奖励函数成为可能。基于我们的观察,我们提出了一种称为 Wasserstein 对抗模仿学习的新方法。我们的方法将 Kantorovich 势作为奖励函数,并进一步利用正则化最优传输以实现大规模应用。在若干机器人实验中,我们的方法在平均累积奖励方面优于基线,并显示出样本效率的显著提升,仅需一次专家演示。

关键词

引用

@article{arxiv.1906.08113,
  title  = {Wasserstein Adversarial Imitation Learning},
  author = {Huang Xiao and Michael Herman and Joerg Wagner and Sebastian Ziesche and Jalal Etesami and Thai Hong Linh},
  journal= {arXiv preprint arXiv:1906.08113},
  year   = {2019}
}