中文

通过形态对象先验实现相机空间中的类别级 3D 对应

计算机视觉与模式识别 2026-05-28 v1

摘要

从图像中理解 3D 物体是机器人和 AR/VR 应用的基本任务。尽管最近的工作在类别级姿态估计方面取得了进展,但当前的表示方法无法捕捉用于推理物体部件、功能和相互作用所需的细粒度语义。在本工作中,我们研究类别级 3D 对应问题,即从单个图像预测在类别内保持一致的 3D 位置;我们表明,通过学习共享的形态对象先验,类别级 3D 对应可以在没有显式对应监督的情况下自然出现。为支持这一方向,我们介绍了 HouseCorr3D,这是第一个大规模的单目类别级 3D 对应基准,包含 178k 张图像,覆盖 50 个家庭用品类别,280 个独特实例,并直接在 CAD 模型上提供 3D 关键点注释。关键的是,HouseCorr3D 提供了遮挡区域的全景对应标签和显式的对称性注释,解决了现有数据集的关键局限性。我们进一步提出了 Morpheus 方法,通过解耦标准形、变形和物体姿态来学习形态类别级形状先验。通过这种共享的标准化 grounding,语义上有意义的相机空间中的 3D 对应得以隐式地自然出现。这些自然出现的 3D 对应在 HouseCorr3D 上取得了新的最佳成绩,表明在没有直接对应监督的情况下,语义 3D 物体理解可以自然产生。数据和代码均可在 https://github.com/GenIntel/HouseCorr3D 上公开获取。

关键词

引用

@article{arxiv.2605.28257,
  title  = {Category-Level 3D Correspondence in Camera Space via Morphable Object Priors},
  author = {Leonhard Sommer and Artur Jesslen and Basavaraj Sunagad and Adam Kortylewski},
  journal= {arXiv preprint arXiv:2605.28257},
  year   = {2026}
}

备注

14 pages, 4 figures. Data and code are publicly available at https://github.com/GenIntel/HouseCorr3D