面向精准机器人操作的层次化音视频-触觉融合
机器人学
2026-02-17 v1 人工智能
摘要
现有机器人操作方法主要依赖视觉和触觉观测,在部分不可观测的真实世界环境中难以推断接触相关的交互状态。相比之下,声学线索自然编码了接触期间的丰富交互动力学,却在当前多模态融合文献中被严重 underutilized。大多数多模态融合方法隐含地假设各模态角色均匀,因而设计平坦对称的融合结构。然而,这一假设不适用于声学信号——其本征稀疏且由接触驱动。为通过声学感知实现精准机器人操作,我们提出一种层次化表示融合框架,逐步整合音频、视觉和触觉信息。我们的 method 首先以声学线索为条件,对视觉和触觉表示进行建模,然后显式建模更高阶的跨模态相互作用,以捕捉模态间的互补依赖。融合后的表示被用于扩散基的 policy,直接从多模态观测生成连续机器人动作。端到端学习与层次化融合结构的结合,使 policy 能够利用任务相关的声学信息,同时抑制来自信息不足模态的干扰。该方法在真实世界的机器人操作任务上进行了评估,包括液体倒酒和橱柜开启。广泛的实验结果表明,我们的方法在声学线索提供的视觉观测难以获取的任务相关信息时,持续优于最先进的多模态融合框架。此外,还对音频线索在机器人操作中的作用进行了互信息分析以进行解释。
引用
@article{arxiv.2602.13640,
title = {Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation},
author = {Siyuan Li and Jiani Lu and Yu Song and Xianren Li and Bo An and Peng Liu},
journal= {arXiv preprint arXiv:2602.13640},
year = {2026}
}