中文

表征学习在视觉模仿中出人意料的有效性

机器人学 2021-12-07 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

尽管视觉模仿学习是从视觉演示中学习的最有效方式之一,但从中泛化需要数百个多样化演示、任务特定先验或庞大且难以训练的参模型。此类复杂性出现的一个原因是,标准视觉模仿框架试图同时解决两个耦合问题:从多样化视觉数据中学习简洁而良好的表征,同时学习将演示动作与此类表征相关联。这种联合学习导致两个问题相互依赖,往往需要使用大量演示进行学习。为应对这一挑战,我们转而提出将视觉模仿中的表征学习与行为学习解耦。首先,我们使用标准监督与自监督学习方法从离线数据学习视觉表征编码器。表征训练完成后,我们使用非参数局部加权回归预测动作。我们通过实验表明,这种简单的解耦在离线演示数据集和真实机器人开门任务上均优于先前视觉模仿工作。我们生成的所有数据、代码和机器人视频均公开于 https://jyopari.github.io/VINN/。

关键词

引用

@article{arxiv.2112.01511,
  title  = {The Surprising Effectiveness of Representation Learning for Visual Imitation},
  author = {Jyothish Pari and Nur Muhammad Shafiullah and Sridhar Pandian Arunachalam and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2112.01511},
  year   = {2021}
}

备注

The first two authors contributed equally