中文

MonoDiff9D:基于扩散模型的单目类目9D物体姿态估计

计算机视觉与模式识别 2025-04-15 v1 机器人学

摘要

物体姿态估计是机器人理解与与环境交互的核心方法。该任务中,单目类目方法因仅需一个RGB摄像机而备受青睐。然而,现有方法依赖物体内部类已知模型的形状先验或CAD模型。我们提出一种基于扩散模型的单目类目9D物体姿态生成方法——MonoDiff9D。我们的动机是利用扩散模型的概率特性,缓解对类内未知物体姿态估计所需的形状先验、CAD模型或深度传感器的依赖。我们首先以零样本方式通过DINOv2从单目图像估计粗糙深度,并将其转换为点云。随后,我们融合点云的全局特征与输入图像,并利用融合特征以及编码时间步长作为MonoDiff9D的条件输入。最后,我们设计了基于Transformer的去噪器,用于从高斯噪声中恢复物体姿态。在两个流行基准数据集上的大量实验表明,MonoDiff9D在无需任何阶段使用形状先验或CAD模型的情况下,实现了单目类目9D物体姿态估计的状态最佳准确性。我们的代码将在https://github.com/CNJianLiu/MonoDiff9D 上公开。

关键词

引用

@article{arxiv.2504.10433,
  title  = {MonoDiff9D: Monocular Category-Level 9D Object Pose Estimation via Diffusion Model},
  author = {Jian Liu and Wei Sun and Hui Yang and Jin Zheng and Zichen Geng and Hossein Rahmani and Ajmal Mian},
  journal= {arXiv preprint arXiv:2504.10433},
  year   = {2025}
}

备注

Accepted by ICRA'25