中文

Diff9D:基于扩散模型的域泛化类别级9自由度物体姿态估计

计算机视觉与模式识别 2025-03-18 v1 机器人学

摘要

九自由度(9-DoF)物体姿态与尺寸估计对于实现增强现实和机器人操作至关重要。类别级方法因其对类内未知物体的泛化潜力而受到广泛研究关注。然而,这些方法需要人工收集和标注大规模真实世界训练数据。为解决这一问题,我们引入了一种基于扩散模型的范式,用于领域泛化的类别级9自由度物体姿态估计。我们的动机是利用扩散模型的潜在泛化能力,以应对物体姿态估计中的领域泛化挑战。这需要模型仅在渲染的合成数据上进行训练,以实现对真实世界场景的泛化。我们提出了一种有效的扩散模型,从生成视角重新定义了9自由度物体姿态估计。我们的模型在训练或推理过程中不需要任何三维形状先验。通过采用去噪扩散隐式模型,我们证明逆向扩散过程只需3步即可执行,实现了近实时性能。最后,我们设计了一个包含硬件和软件组件的机器人抓取系统。通过在两个基准数据集和真实世界机器人系统上的综合实验,我们表明我们的方法达到了最先进的领域泛化性能。我们的代码将在 https://github.com/CNJianLiu/Diff9D 上公开。

关键词

引用

@article{arxiv.2502.02525,
  title  = {Diff9D: Diffusion-Based Domain-Generalized Category-Level 9-DoF Object Pose Estimation},
  author = {Jian Liu and Wei Sun and Hui Yang and Pengchao Deng and Chongpei Liu and Nicu Sebe and Hossein Rahmani and Ajmal Mian},
  journal= {arXiv preprint arXiv:2502.02525},
  year   = {2025}
}

备注

17 pages, 13 figures