中文

用于表征学习的游戏式交互

机器人学 2021-07-20 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

视觉模仿学习的关键挑战之一是为给定任务收集大量专家演示。虽然借助遥操作方法和低成本辅助工具,收集人类演示的方法正变得更容易,但对于每个任务,我们通常仍需要 100–1000 个演示来学习视觉表征与策略。为此,我们转向一种不需要任务特定演示的替代数据形式——游戏(play)。游戏是儿童在早期学习中用来学习一组技能、行为与视觉表征的基本方法。重要的是,游戏数据具有多样性、任务无关性,且获取成本相对较低。在本工作中,我们提出以自监督方式利用游戏式交互来学习下游任务的视觉表征。我们在 19 种多样环境中收集了 2 小时游戏数据,并使用自预测学习提取视觉表征。给定这些表征,我们通过模仿学习为两个下游任务训练策略:推挤(Pushing)与堆叠(Stacking)。我们证明,我们的视觉表征比标准行为克隆泛化更好,且仅需一半数量的所需演示即可达到相似性能。我们从头训练的表征优于 ImageNet 预训练表征。最后,我们对不同预训练模式对下游任务学习的影响进行了实验分析。

关键词

引用

@article{arxiv.2107.09046,
  title  = {Playful Interactions for Representation Learning},
  author = {Sarah Young and Jyothish Pari and Pieter Abbeel and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2107.09046},
  year   = {2021}
}