中文

看、听、感:面向机器人操作的智能感官融合

机器人学 2022-12-09 v2 计算机视觉与模式识别

摘要

人类在日常活动中利用所有感官来完成不同任务。相比之下,现有机器人操作研究大多依赖一种,偶尔两种模态,如视觉与触觉。本工作中,我们系统研究视觉、听觉与触觉感知如何共同帮助机器人解决复杂操作任务。我们构建了一个机器人系统,可通过相机看见、通过接触式麦克风听见、通过基于视觉的触觉传感器感知,三种感官模态均通过自注意力模型融合。在密集装箱与倾倒两项挑战性任务上的结果表明,多感官感知对于机器人操作的必要性与威力:视觉显示机器人全局状态但常受遮挡影响,音频提供即便不可见的关键时刻即时反馈,触觉为决策提供精确局部几何。利用全部三种模态,我们的机器人系统显著优于先前方法。

关键词

引用

@article{arxiv.2212.03858,
  title  = {See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation},
  author = {Hao Li and Yizhi Zhang and Junzhe Zhu and Shaoxiong Wang and Michelle A Lee and Huazhe Xu and Edward Adelson and Li Fei-Fei and Ruohan Gao and Jiajun Wu},
  journal= {arXiv preprint arXiv:2212.03858},
  year   = {2022}
}

备注

In CoRL 2022. Li and Zhang equal contribution; Gao and Wu equal advising. Project page: https://ai.stanford.edu/~rhgao/see_hear_feel/