基于沃瑟斯坦距离引导与奖励形状探索的对抗模仿学习
机器学习
2020-12-09 v2 机器人学
机器学习
摘要
生成对抗模仿学习(GAIL)为从高维连续任务演示中模仿专家策略提供了对抗学习框架。然而,几乎所有GAIL及其扩展仅在对抗训练策略中针对所有复杂环境设计了一种基于Jensen-Shannon(JS)散度的对数形式奖励函数。固定的对数型奖励函数可能难以求解所有复杂任务,且JS散度引起的梯度消失问题会损害对抗学习过程。本文提出一种名为沃瑟斯坦距离引导的对抗模仿学习(WDAIL)的新算法,以提升模仿学习(IL)性能。我们的方法有三处改进:(a)引入沃瑟斯坦距离以在对抗训练过程中获得更恰当的度量;(b)在强化学习阶段使用近端策略优化(PPO),其实现更为简便并使算法更高效;(c)探索不同奖励函数形状以适应不同任务从而提升性能。实验结果表明,学习过程保持显著稳定,并在MuJoCo的复杂连续控制任务中取得显著性能。
引用
@article{arxiv.2006.03503,
title = {Wasserstein Distance guided Adversarial Imitation Learning with Reward Shape Exploration},
author = {Ming Zhang and Yawei Wang and Xiaoteng Ma and Li Xia and Jun Yang and Zhiheng Li and Xiu Li},
journal= {arXiv preprint arXiv:2006.03503},
year = {2020}
}
备注
M. Zhang and Y. Wang contribute equally to this work