中文

基于 Transformer 的泛化神经辐射场用于新视角合成

计算机视觉与模式识别 2022-06-14 v1

摘要

我们提出一种基于 Transformer 的 NeRF(TransNeRF),以观测视角图像为条件学习通用神经辐射场,用于新视角合成任务。相比之下,现有的基于 MLP 的 NeRF 无法直接接收任意数量的观测视角,且需要基于池化的辅助操作来融合源视角信息,导致源视角与目标渲染视角之间复杂关系的丢失。此外,当前方法逐个处理每个 3D 点,忽略了辐射场场景表示的局部一致性。这些局限可能会降低它们在源视角与新渲染视角可能存在较大差异的具挑战性真实应用中的性能。为应对这些挑战,我们的 TransNeRF 利用注意力机制将任意数量源视角的深层关联自然解码为基于坐标的场景表示。形状与外观的局部一致性在光线投射空间与周围视角空间内于统一的 Transformer 网络中得以考虑。实验表明,我们的 TransNeRF 在大量不同场景上训练后,在场景无关与逐场景微调两种设定下,相较于最先进的基于图像的神经渲染方法均能取得更好性能,尤其在源视角与渲染视角差距较大时。

关键词

引用

@article{arxiv.2206.05375,
  title  = {Generalizable Neural Radiance Fields for Novel View Synthesis with Transformer},
  author = {Dan Wang and Xinrui Cui and Septimiu Salcudean and Z. Jane Wang},
  journal= {arXiv preprint arXiv:2206.05375},
  year   = {2022}
}