关于从观测模仿学习与从演示模仿学习之间可保证的几乎等价性
机器人学
2020-10-19 v1 机器学习
摘要
从观测模仿学习(LfO)比从演示模仿学习(LfD)更可取,因为在从专家数据重建专家策略时不需要专家动作。然而,先前的研究暗示 LfO 的性能比 LfD 差一个巨大的差距,这使得在实践中采用 LfO 具有挑战性。相比之下,本文证明了在确定性机器人环境中 LfO 几乎等价于 LfD,更一般地,即使在具有有界随机性的机器人环境中也几乎等价。在确定性机器人环境中,从控制理论的角度,我们表明 LfO 与 LfD 之间的逆动力学差异趋于零,意味着 LfO 几乎等价于 LfD。为了进一步放宽确定性约束并更好地适应实际环境,我们考虑机器人环境中有界随机性,并证明在更一般的设定下 LfD 与 LfO 的优化目标几乎相同。我们针对多个机器人任务进行了大量实验,以经验性地证明 LfO 取得了与 LfD 相当的性能。事实上,现实中大多数常见机器人系统都是具有有界随机性的机器人环境(即本文所考虑的环境)。因此,我们的发现极大地扩展了 LfO 的潜力,并表明在实践中我们可以安全地应用 LfO,而相较于 LfD 不牺牲性能。
引用
@article{arxiv.2010.08353,
title = {On the Guaranteed Almost Equivalence between Imitation Learning from Observation and Demonstration},
author = {Zhihao Cheng and Liu Liu and Aishan Liu and Hao Sun and Meng Fang and Dacheng Tao},
journal= {arXiv preprint arXiv:2010.08353},
year = {2020}
}