感官之力:基于掩码多模态学习的视觉与触觉可泛化操作
机器人学
2023-11-03 v1 人工智能
摘要
人类在大多数基本任务中依赖感官的协同。对于需要物体操作的任务,我们无缝且高效地利用视觉与触觉的互补性。本文受此类能力启发,旨在寻找一种在强化学习设定中融合视觉与触觉信息的系统化方法。我们提出掩码多模态学习(Masked Multimodal Learning, M3L),其基于掩码自编码联合学习策略与视觉-触觉表示。从视觉与触觉联合学习的表示提升了样本效率,并解锁了超越任一单独感官所能实现的泛化能力。值得注意的是,多模态设定下学习的表示在测试时也惠及仅视觉策略。我们在三个具备视觉与触觉观测的仿真环境中评估 M3L:机器人插入、开门以及灵巧手中操作,展示了学习多模态策略的益处。实验代码与视频见 https://sferrazza.cc/m3l_site。
引用
@article{arxiv.2311.00924,
title = {The Power of the Senses: Generalizable Manipulation from Vision and Touch through Masked Multimodal Learning},
author = {Carmelo Sferrazza and Younggyo Seo and Hao Liu and Youngwoon Lee and Pieter Abbeel},
journal= {arXiv preprint arXiv:2311.00924},
year = {2023}
}