原始Wasserstein模仿学习
机器学习
2021-03-18 v2 机器学习
摘要
模仿学习(IL)方法力求使智能体的行为与该专家的行为相匹配。在本工作中,我们提出一种基于概念上简单算法的新 IL 方法:原始 Wasserstein 模仿学习(PWIL),其关联到专家与智能体状态-动作分布间 Wasserstein 距离的原始形式。我们给出一种离线导出的奖励函数,不同于近期通过对环境交互学习奖励函数的对抗式 IL 算法,且只需很少的微调。我们表明,在 MuJoCo 领域的多种连续控制任务上,就智能体交互与专家环境交互而言,我们能以样本高效的方式恢复专家行为。最后,我们表明我们所训练智能体的行为以 Wasserstein 距离(而非常用的性能代理)与专家行为相匹配。
引用
@article{arxiv.2006.04678,
title = {Primal Wasserstein Imitation Learning},
author = {Robert Dadashi and Léonard Hussenot and Matthieu Geist and Olivier Pietquin},
journal= {arXiv preprint arXiv:2006.04678},
year = {2021}
}
备注
Published in International Conference on Learning Representations (ICLR 2021)