理解视觉与触觉:面向接触丰富任务的多模态表示学习
机器人学
2019-07-31 v1 机器学习
摘要
非结构化环境中的接触丰富操作任务通常需要触觉与视觉反馈。手动设计一个结合这些特性迥异模态的机器人控制器并非易事。尽管深度强化学习在从高维输入学习控制策略方面已取得成效,但由于样本复杂度问题,这些算法通常难以在真实机器人上部署。在本工作中,我们利用自监督学习得到感官输入的紧凑多模态表示,进而用于提升策略学习的样本效率。在插孔任务上评估我们的方法,表明其可泛化至不同几何形状、配置与间隙,并对外部扰动具有鲁棒性。我们还系统地研究了不同的自监督学习目标与表示学习架构。结果在仿真与物理机器人上均有呈现。
引用
@article{arxiv.1907.13098,
title = {Making Sense of Vision and Touch: Learning Multimodal Representations for Contact-Rich Tasks},
author = {Michelle A. Lee and Yuke Zhu and Peter Zachares and Matthew Tan and Krishnan Srinivasan and Silvio Savarese and Li Fei-Fei and Animesh Garg and Jeannette Bohg},
journal= {arXiv preprint arXiv:1907.13098},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1810.10191