中文

SDFit:通过将可变形 SDF 拟合到单张图像来估计 3D 物体姿态与形状

计算机视觉与模式识别 2025-08-01 v3

摘要

从单张图像中恢复 3D 物体的姿态和形状是一个具有挑战性的不适定问题。这是由于强烈的(自)遮挡、深度模糊、巨大的类内和类间形状差异,以及自然图像缺乏 3D 真值所致。现有的深度网络方法在合成数据集上进行训练以预测 3D 形状,因此通常难以泛化到真实世界图像。此外,它们缺乏用于优化噪声估计的显式反馈循环,并且主要关注几何结构而未直接考虑像素对齐。为了解决这些局限性,我们开发了一种新颖的渲染并比较优化框架,称为 SDFit。它具有三项关键创新:首先,它使用一个学习得到的类别特定的可变形符号距离函数 (mSDF) 模型,并通过迭代优化 3D 姿态和形状将其拟合到图像。mSDF 通过将搜索约束在有效形状的流形上增强了推理的鲁棒性,同时允许任意形状拓扑。其次,SDFit 利用基础模型在 3D 形状数据库中进行高效查找,从而检索出可能与图像匹配的初始 3D 形状。第三,SDFit 通过基础特征在图像和 mSDF 之间建立丰富的 2D-3D 对应关系来初始化姿态。我们在三个图像数据集,即 Pix3D、Pascal3D+ 和 COMIC 上对 SDFit 进行了评估。对于无遮挡图像和常见姿态,SDFit 的表现与 SotA 前馈网络相当,但对遮挡和罕见姿态具有独特的鲁棒性。此外,它不需要对未见图像进行重新训练。因此,SDFit 为在野外环境中的泛化提供了新见解。代码可在 https://anticdimi.github.io/sdfit 获取。

关键词

引用

@article{arxiv.2409.16178,
  title  = {SDFit: 3D Object Pose and Shape by Fitting a Morphable SDF to a Single Image},
  author = {Dimitrije Antić and Georgios Paschalidis and Shashank Tripathi and Theo Gevers and Sai Kumar Dwivedi and Dimitrios Tzionas},
  journal= {arXiv preprint arXiv:2409.16178},
  year   = {2025}
}

备注

ICCV'25 Camera Ready; 12 pages, 11 figures, 5 tables