中文

稀疏视角姿态估计与重建:基于生成式合成的分析

计算机视觉与模式识别 2024-12-05 v1

摘要

推断多视图图像背后的 3D 结构通常需要解决两个相互依赖的任务——准确的 3D 重建需要精确的相机姿态,而预测相机姿态则依赖(隐式或显式)建模底层 3D 结构。经典的分析-合成框架将此推理建模为寻找解释观测像素的联合优化问题,最近的实现方式会学习表达力强的 3D 表示(如神经场),并使用基于梯度下降的姿态细化来调整初始姿态估计。然而,给定稀疏的观测视角,观测可能不提供足够的直接证据来获得完整且准确的 3D。此外,姿态估计中的大误差可能难以纠正,进而进一步恶化推断的 3D。为在这一具有挑战性的设置下实现稳健的 3D 重建和姿态估计,我们提出了 SparseAGS 方法,通过:a) 引入基于新视角合成的生成式先验,结合光度目标来提高推断 3D 的质量;b) 显式推理离群值,并使用连续优化策略进行离散搜索来纠正它们。我们在真实数据集和合成数据集上对该框架进行了验证,结合了多个即插即用姿态估计系统作为初始化。我们发现该方法显著改进了基本系统的姿态精度,同时产生高质量的 3D 重建结果,优于当前多视图重建基线方法的结果。

关键词

引用

@article{arxiv.2412.03570,
  title  = {Sparse-view Pose Estimation and Reconstruction via Analysis by Generative Synthesis},
  author = {Qitao Zhao and Shubham Tulsiani},
  journal= {arXiv preprint arXiv:2412.03570},
  year   = {2024}
}

备注

NeurIPS 2024. Project website: https://qitaozhao.github.io/SparseAGS