中文

基于模型的对抗式模仿学习

机器学习 2016-12-08 v1 机器学习

摘要

生成对抗学习是一种流行的训练生成模型的新方法,并已被证明在其他相关问题上同样成功。其总体思路是维护一个判别器 DD,用于区分专家数据分布与生成模型 GG 的数据分布。生成模型通过最大化 DD 对其生成数据进行误分类的概率,来学习捕捉专家的分布。整个系统是端到端可微的,并使用基本的反向传播进行训练。这类学习已成功应用于无模型设定下的策略模仿问题。然而,无模型方法不允许系统可微,这需要使用高方差的梯度估计。本文我们引入基于模型的对抗式模仿学习(MAIL)算法,这是一种用于对抗式模仿学习问题的基于模型的方法。我们展示了如何使用前向模型使系统完全可微,从而能够利用 DD 的(随机)梯度来训练策略。此外,我们的方法需要相对较少的环境交互,且需要调优的超参数也更少。我们在 MuJoCo 物理模拟器上测试了我们的方法,并报告了超越当前最优水平的初步结果。

关键词

引用

@article{arxiv.1612.02179,
  title  = {Model-based Adversarial Imitation Learning},
  author = {Nir Baram and Oron Anschel and Shie Mannor},
  journal= {arXiv preprint arXiv:1612.02179},
  year   = {2016}
}