中文

理解视觉与触觉:面向接触丰富任务的多模态表示学习

机器人学 2019-07-31 v1 机器学习

摘要

非结构化环境中的接触丰富操作任务通常需要触觉与视觉反馈。手动设计一个结合这些特性迥异模态的机器人控制器并非易事。尽管深度强化学习在从高维输入学习控制策略方面已取得成效,但由于样本复杂度问题,这些算法通常难以在真实机器人上部署。在本工作中,我们利用自监督学习得到感官输入的紧凑多模态表示,进而用于提升策略学习的样本效率。在插孔任务上评估我们的方法,表明其可泛化至不同几何形状、配置与间隙,并对外部扰动具有鲁棒性。我们还系统地研究了不同的自监督学习目标与表示学习架构。结果在仿真与物理机器人上均有呈现。

关键词

引用

@article{arxiv.1907.13098,
  title  = {Making Sense of Vision and Touch: Learning Multimodal Representations for Contact-Rich Tasks},
  author = {Michelle A. Lee and Yuke Zhu and Peter Zachares and Matthew Tan and Krishnan Srinivasan and Silvio Savarese and Li Fei-Fei and Animesh Garg and Jeannette Bohg},
  journal= {arXiv preprint arXiv:1907.13098},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1810.10191