中文

GoLF-NRT:融合全局上下文与局部几何的少视角视图合成

计算机视觉与模式识别 2025-05-27 v1

摘要

神经辐射场(NeRF)通过直接从图像建模特定于场景的体积表示,改变了新视图合成。虽然可泛化的 NeRF 模型可以通过学习潜在射线表示在未知场景间生成新视图,但其性能严重依赖于大量的多视图观测。然而,在输入视图有限的情况下,这些方法的渲染质量会显著下降。为解决这一局限性,我们提出了 GoLF-NRT:一种基于全局与局部特征融合的神经渲染 Transformer。GoLF-NRT 利用具有高效稀疏注意力的 3D Transformer 捕获全局场景上下文,从而增强从少量输入视图进行的可泛化神经渲染。同时,它整合了沿极线提取的局部几何特征,使得仅需 1 到 3 个输入视图即可实现高质量的场景重建。此外,我们引入了一种基于注意力权重和核回归的自适应采样策略,提高了基于 Transformer 的神经渲染的准确性。在公开数据集上的广泛实验表明,GoLF-NRT 在不同数量的输入视图下均实现了 SOTA 性能,突出了我们方法的有效性和优越性。代码可在 https://github.com/KLMAV-CUC/GoLF-NRT 获取。

关键词

引用

@article{arxiv.2505.19813,
  title  = {GoLF-NRT: Integrating Global Context and Local Geometry for Few-Shot View Synthesis},
  author = {You Wang and Li Fang and Hao Zhu and Fei Hu and Long Ye and Zhan Ma},
  journal= {arXiv preprint arXiv:2505.19813},
  year   = {2025}
}

备注

CVPR 2025