中文

基于状态观测器从视频进行对抗模仿学习

机器人学 2022-07-28 v2 人工智能 计算机视觉与模式识别 机器学习 系统与控制 系统与控制

摘要

模仿学习研究界近期在使人工智能体仅从视频演示模仿行为这一目标上取得了显著进展。然而,当前为此问题开发的最先进方法表现出高样本复杂度,部分归因于视频观测的高维特性。为应对此问题,我们在此引入一种称为基于状态观测器的视觉生成对抗观察模仿(VGAIfO-SO)的新算法。VGAIfO-SO的核心在于利用一种新颖的自监督状态观测器来解决样本低效问题,该观测器从高维图像中估计出低维本体感知状态表示。我们在多个连续控制环境中通过实验表明,VGAIfO-SO在从仅视频演示学习时比其他IfO算法更具样本效率,且有时甚至能达到具有演示者本体感知状态信息特权的生成对抗观察模仿(GAIfO)算法的相近性能。

关键词

引用

@article{arxiv.2202.00243,
  title  = {Adversarial Imitation Learning from Video using a State Observer},
  author = {Haresh Karnan and Garrett Warnell and Faraz Torabi and Peter Stone},
  journal= {arXiv preprint arXiv:2202.00243},
  year   = {2022}
}