中文

Few-shot View Synthesis 的通用对象作为姿态探针

计算机视觉与模式识别 2025-04-30 v4

摘要

辐射场包括 NeRF 和 3D 高斯模型在内显示出在高保真渲染和场景重建方面的巨大潜力,但它们需要大量带姿态图像作为输入。COLMAP 常用于预处理以估计姿态,但它需要大量特征匹配才能有效运作,且在特征稀疏、图像间基线大或输入图像数量有限的场景中难以处理。我们旨在解决仅使用 3 至 6 张未标定场景图像进行 few-view NeRF 重建的问题。传统方法常使用校准板,但它们在图像中并不常见。我们提出了一种新颖想法,即利用日常对象(在图像和现实世界中都常见)作为 "姿态探针"。该探针对象通过 SAM 自动分割,其形状初始化来自立方体。我们应用双分支体积渲染优化(对象 NeRF 和场景 NeRF)以约束姿态优化并联合细化几何。具体而言,通过 SDF 表示中的 PnP 匹配估计两个视角的对象姿态,这作为初始姿态。PnP 匹配只需少量特征,适用于特征稀疏的场景。随后逐步加入额外视角以细化来自前述视角的姿态。在实验中,PoseProbe 在多个数据集上在姿态估计和新视角合成方面实现了最好的性能。我们展示了其有效性,特别是在 few-view 和大基线场景中,其中 COLMAP 难以处理。在消融实验中,使用场景中不同的对象可获得相当的性能。我们的项目页面可在此处访问: \href{https://zhirui-gao.github.io/PoseProbe.github.io/}{this https URL}。

关键词

引用

@article{arxiv.2408.16690,
  title  = {Generic Objects as Pose Probes for Few-shot View Synthesis},
  author = {Zhirui Gao and Renjiao Yi and Chenyang Zhu and Ke Zhuang and Wei Chen and Kai Xu},
  journal= {arXiv preprint arXiv:2408.16690},
  year   = {2025}
}

备注

Accepted by IEEE TCSVT 2025 Project page: https://zhirui-gao.github.io/PoseProbe.github.io/