基于模型的对抗式模仿学习
机器学习
2016-12-08 v1 机器学习
摘要
生成对抗学习是一种流行的训练生成模型的新方法,并已被证明在其他相关问题上同样成功。其总体思路是维护一个判别器 ,用于区分专家数据分布与生成模型 的数据分布。生成模型通过最大化 对其生成数据进行误分类的概率,来学习捕捉专家的分布。整个系统是端到端可微的,并使用基本的反向传播进行训练。这类学习已成功应用于无模型设定下的策略模仿问题。然而,无模型方法不允许系统可微,这需要使用高方差的梯度估计。本文我们引入基于模型的对抗式模仿学习(MAIL)算法,这是一种用于对抗式模仿学习问题的基于模型的方法。我们展示了如何使用前向模型使系统完全可微,从而能够利用 的(随机)梯度来训练策略。此外,我们的方法需要相对较少的环境交互,且需要调优的超参数也更少。我们在 MuJoCo 物理模拟器上测试了我们的方法,并报告了超越当前最优水平的初步结果。
引用
@article{arxiv.1612.02179,
title = {Model-based Adversarial Imitation Learning},
author = {Nir Baram and Oron Anschel and Shie Mannor},
journal= {arXiv preprint arXiv:1612.02179},
year = {2016}
}