中文

物体姿态与形状估计用于抓取:是否有效?

机器人学 2026-05-27 v1 计算机视觉与模式识别

摘要

物体姿态与形状估计问题近期取得了重要进展。编码器-解码器模型(如 SAM3D、LRM、CRISP)和扩散模型(如 InstantMesh、Zero123、SceneComplete)表现出类别不可知的形状编码能力和开放集泛化能力。本文探讨了一个问题:是否成熟的物体姿态与形状估计方法足以与对极抓取采样结合使用,从而优于端到端抓取合成方法?我们严格限制在平行夹爪、7自由度抓取以及单视图RGB(-D)图像输入的情况下,对该问题进行详细研究。我们实现并比较了一种最新的端到端抓取合成方法和三种模块化方法,这些方法首先估计场景中所有物体的姿态与形状,然后通过对极采样生成抓取。我们观察到在所有实验中,模块化方法均优于端到端方法。模块化方法能够为小物体生成大量抓取,而端到端方法则失败。模块化方法的有效性取决于姿态与形状估计的准确性,在杂乱场景中会出现部分性能下降——这是现有姿态与形状估计方法的局限性。我们还分析了三种模块化方法的失效模式和运行时间,这些方法使用两种不同的物体姿态与形状估计方式:一种基于编码器-解码器模型,另一种基于扩散模型。最后,我们演示了单视图物体姿态与形状估计方法可通过引入视觉语言模型,从仅给定单视图RGB-D图像生成语言条件抓取。我们注意到性能与最新SOTA基线 LERF-TOGO 相当。

关键词

引用

@article{arxiv.2605.26944,
  title  = {Object Pose and Shape Estimation for Grasping: Does it Work?},
  author = {Pavan Karke and Kushal Shah and Gaurav Singh and Md Faizal Karim and K Madhava Krishna and Rajat Talak},
  journal= {arXiv preprint arXiv:2605.26944},
  year   = {2026}
}

备注

9 pages, 8 figures