中文

基于3D原型的RGB图像统一的类别级目标检测与姿态估计

计算机视觉与模式识别 2025-08-05 v1

摘要

目标检测是计算机视觉中的一个基本问题。虽然在2D图像中检测目标很常见,但许多应用需要确定它们在3D空间中的姿态。传统的类别级方法依赖RGB-D输入,这在某些情况下可能不可得,或采用两阶段方法,使用单独的模型和表示进行检测和姿态估计。为此,首次我们引入了一个统一模型,将检测和姿态估计集成到单个框架中,用于RGB图像,利用带有学习特征的神经网格模型和多模型RANSAC。我们的方法在REAL275数据集上实现了RGB类别级姿态估计的状态最佳结果,平均提升了22.9%。最后,我们证明了与单阶段基线相比,我们的统一方法表现出更大的鲁棒性。我们的代码和模型可在 https://github.com/Fischer-Tom/unified-detection-and-pose-estimation 获取。

关键词

引用

@article{arxiv.2508.02157,
  title  = {Unified Category-Level Object Detection and Pose Estimation from RGB Images using 3D Prototypes},
  author = {Tom Fischer and Xiaojie Zhang and Eddy Ilg},
  journal= {arXiv preprint arXiv:2508.02157},
  year   = {2025}
}

备注

Published at ICCV 2025