中文

学会何时看何时感知:面向接触感知操作的自适应视觉-力矩融合

机器人学 2026-04-03 v1

摘要

基于视觉的策略由于视觉观测的可及性和丰富性,在机器人操作中取得了良好性能。然而,纯视觉感知在接触密集和力敏感任务中变得不足,其中力/力矩(F/T)信号提供关于接触动力学、对齐和交互质量的关键信息。尽管已提出各种策略来整合视觉和F/T信号,包括辅助预测目标、专家混合架构和接触感知门控机制,但这些方法的比较仍缺乏。在这项工作中,我们在基于扩散的操作策略中比较了不同的F/T-视觉整合策略。此外,我们提出了一种自适应整合策略,在非接触阶段忽略F/T信号,而在接触阶段自适应地利用视觉和力矩信息。实验结果表明,我们的方法在成功率上比最强基线高出14%,突出了接触感知多模态融合在机器人操作中的重要性。

关键词

引用

@article{arxiv.2604.01414,
  title  = {Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation},
  author = {Jiuzhou Lei and Chang Liu and Yu She and Xiao Liang and Minghui Zheng},
  journal= {arXiv preprint arXiv:2604.01414},
  year   = {2026}
}