阶段引导的动态多模态融合用于机器人操控
机器人学
2024-10-28 v2 计算机视觉与模式识别
摘要
人类在与环境交互时具备灵活切换不同感官的卓越能力。试想一位厨师熟练地根据颜色、声音和气味来判断食材添加时机并控制火候,无缝地贯穿复杂烹饪过程的每个阶段。这种能力建立在对任务阶段的透彻理解之上,因为每个阶段内实现子目标可能需要利用不同的感官。为赋予机器人类似的能力,我们将按子目标划分的任务阶段引入模仿学习过程,以相应地引导动态多模态融合。我们提出了 MS-Bot,一种具有粗到细阶段理解的阶段引导动态多模态融合方法,它根据预测当前阶段内的细粒度状态动态调整模态优先级。我们训练了一个配备视觉、听觉和触觉传感器的机器人系统来完成具有挑战性的机器人操控任务:倾倒和带键槽的销钉插入。实验结果表明,我们的方法实现了更有效且可解释的动态融合,比现有方法更贴近人类的融合过程。
引用
@article{arxiv.2408.01366,
title = {Play to the Score: Stage-Guided Dynamic Multi-Sensory Fusion for Robotic Manipulation},
author = {Ruoxuan Feng and Di Hu and Wenke Ma and Xuelong Li},
journal= {arXiv preprint arXiv:2408.01366},
year = {2024}
}
备注
accepted by CoRL2024(oral)