通过最小化逆动力学差异从观测中进行模仿学习
机器学习
2019-11-19 v4 人工智能
机器人学
机器学习
摘要
本文研究用于模仿学习的从观测中学习(LfO),其仅能获取状态演示。与同时包含动作与状态监督的从演示中学习(LfD)相比,LfO 在利用先前不可用的资源(如视频)方面更为实用,但由于专家指导不完整也更具挑战性。本文从理论与实际两个角度研究 LfO 及其与 LfD 的差异。我们首先证明,若遵循 GAIL 的建模方法,LfD 与 LfO 之间的差距实际上在于模仿者与专家之间逆动力学模型的分歧。更重要的是,该差距的上界由一个负因果熵揭示,并可以无模型的方式进行最小化。我们将所提方法称为逆动力学差异最小化(IDDM),其通过进一步弥合与 LfD 的差距来增强传统的 LfO 方法。在具有挑战性的基准上的大量实验结果表明,我们的方法相对于其他 LfO 方法取得了持续的改进。
引用
@article{arxiv.1910.04417,
title = {Imitation Learning from Observations by Minimizing Inverse Dynamics Disagreement},
author = {Chao Yang and Xiaojian Ma and Wenbing Huang and Fuchun Sun and Huaping Liu and Junzhou Huang and Chuang Gan},
journal= {arXiv preprint arXiv:1910.04417},
year = {2019}
}
备注
Accepted to NeurIPS 2019 as a spotlight. Chao Yang and Xiaojian Ma contributed equally to this work