中文

V-HOP: 视觉-触觉 6D 物体姿态跟踪

机器人学 2025-09-12 v2 人工智能 计算机视觉与模式识别

摘要

人类在操作过程中自然地整合视觉和触觉以实现稳健的物体感知。任一模态的缺失都会显著降低性能。受这种多感官整合的启发,先前的物体姿态估计研究尝试结合视觉和触觉/触感反馈。尽管这些工作在受控环境或合成数据集中展现出改进,但由于在不同夹爪、传感器布局或仿真到现实(sim-to-real)环境之间泛化能力差,它们在真实世界场景中的表现往往不如纯视觉方法。此外,它们通常独立估计每一帧的物体姿态,导致在真实世界部署中序列上的跟踪连贯性较差。为了解决这些局限性,我们引入了一种新颖的统一触觉表示,能够有效处理多种夹爪形态。基于这种表示,我们引入了一种新的基于 Transformer 的视觉-触觉物体姿态跟踪器,无缝集成了视觉和触觉输入。我们在我们的数据集和 Feelsight 数据集中验证了我们的框架,展示了在具有挑战性的序列上的显著性能提升。值得注意的是,我们的方法在新型形态、物体和传感器类型(基于触觉单元和基于视觉的触觉传感器)上均实现了卓越的泛化能力和鲁棒性。在真实世界实验中,我们证明了我们的方法以大幅优势超越了 SOTA 视觉跟踪器。我们进一步表明,通过将我们的实时物体跟踪结果纳入运动规划,可以实现精确的操作任务,凸显了视觉-触觉感知的优势。项目网站:https://ivl.cs.brown.edu/research/v-hop

关键词

引用

@article{arxiv.2502.17434,
  title  = {V-HOP: Visuo-Haptic 6D Object Pose Tracking},
  author = {Hongyu Li and Mingxi Jia and Tuluhan Akbulut and Yu Xiang and George Konidaris and Srinath Sridhar},
  journal= {arXiv preprint arXiv:2502.17434},
  year   = {2025}
}

备注

Accepted by RSS 2025