中文

ViTa-Zero:零样态视觉-触觉物体 6 自由度姿态估计

机器人学 2025-04-18 v1 计算机视觉与模式识别

摘要

物体 6D 姿态估计是机器人操作中的关键挑战,尤其是对于操纵任务而言。尽管前期研究结合视觉与触觉(视觉-触觉)信息显示出前景,但这些方法往往因视觉-触觉数据的有限性而难以泛化。在本文中,我们引入 ViTa-Zero,一个零样态视觉-触觉姿态估计框架。我们的核心创新在于将视觉模型作为 backbone,并基于触觉与本体感知观察导出的物理约束进行可行性检查和测试时优化。具体而言,我们将夹爪-物体交互建模为弹簧-质量系统,其中触觉传感器产生吸引力,而本体感知产生排斥力。我们通过真实世界的机器人实验验证了该框架,展示了其在各种代表性视觉 backbone 和操纵场景中的有效性,包括抓取、物体提取和双手传递。在我们的实验中,该方法在 ADD-S 和 ADD 指标上平均提升 55% 和 60%,位置误差降低 80%。

关键词

引用

@article{arxiv.2504.13179,
  title  = {ViTa-Zero: Zero-shot Visuotactile Object 6D Pose Estimation},
  author = {Hongyu Li and James Akl and Srinath Sridhar and Tye Brady and Taskin Padir},
  journal= {arXiv preprint arXiv:2504.13179},
  year   = {2025}
}

备注

Accepted by ICRA 2025