中文

FocalPose++:基于渲染与比较的焦距与物体姿态估计

计算机视觉与模式识别 2024-11-08 v2

摘要

我们提出了 FocalPose++,这是一种神经渲染与比较方法,用于在给定单张描绘已知物体的 RGB 输入图像时,联合估计相机-物体的 6D 姿态和相机焦距。本工作的贡献有三方面。首先,我们推导了一个焦距更新规则,该规则扩展了现有最先进的渲染与比较 6D 姿态估计器,以解决联合估计任务。其次,我们研究了用于联合估计物体姿态和焦距的几种不同损失函数。我们发现,将直接焦距回归与一个解耦平移、旋转和焦距贡献的重投影损失相结合,能够带来改进的结果。第三,我们探索了不同合成训练数据对我们方法性能的影响。具体来说,我们研究了在渲染合成图像时用于采样物体 6D 姿态和相机焦距的不同分布,并表明在真实训练数据上拟合的参数分布效果最佳。我们在三个具有挑战性的基准数据集上展示了结果,这些数据集描绘了非受控环境中的已知 3D 模型。我们证明,我们的焦距和 6D 姿态估计误差低于现有的最先进方法。

关键词

引用

@article{arxiv.2312.02985,
  title  = {FocalPose++: Focal Length and Object Pose Estimation via Render and Compare},
  author = {Martin Cífka and Georgy Ponimatkin and Yann Labbé and Bryan Russell and Mathieu Aubry and Vladimir Petrik and Josef Sivic},
  journal= {arXiv preprint arXiv:2312.02985},
  year   = {2024}
}

备注

25 pages, 22 figures. IEEE TPAMI, 2024. Extended version of the conference paper arXiv:2204.05145