并发训练提升从观测进行行为克隆的性能
机器学习
2020-08-05 v1 机器人学
机器学习
摘要
从演示中学习被广泛用作机器人获取新技能的高效方式。然而,它通常要求演示提供对状态和动作序列的完全访问。相比之下,从观测学习提供了一种利用无标签演示(例如视频)来执行模仿学习的方法。其中一种途径是从观测进行行为克隆(BCO)。BCO 的原始实现首先学习一个逆动力学模型,然后使用该模型估计动作标签,从而将问题归约为行为克隆。然而,现有的 BCO 方法在第一步中需要大量初始交互。在此,我们对 BCO 提供了新的理论分析,引入了改进版 BCO*,并表明在半监督设定下,BCO* 可同时改进其逆动力学模型估计与专家策略。该结果使我们能够消除对初始交互的依赖,并大幅改善 BCO 的样本复杂度。我们通过各类基准领域的实验评估了算法的有效性。结果表明,并发训练不仅优于 BCO 的性能,而且达到了与 GAIL 和 Value-Dice 等最先进模仿学习方法具有竞争力的表现。
引用
@article{arxiv.2008.01205,
title = {Concurrent Training Improves the Performance of Behavioral Cloning from Observation},
author = {Zachary W. Robertson and Matthew R. Walter},
journal= {arXiv preprint arXiv:2008.01205},
year = {2020}
}
备注
13 pages, 2 figures, Submitted to the 4th Conference on Robot Learning (CoRL 2020)