中文

注意力是NeRF所需的全部吗?

计算机视觉与模式识别 2023-03-03 v3

摘要

我们提出通用化NeRF Transformer (GNT),一种基于Transformer的架构,可重建神经辐射场(NeRFs)并从源视图即时学习渲染新视角。先前关于NeRF的工作通过反演手工设计的渲染方程来优化场景表示,而GNT利用Transformer在两个阶段实现跨场景泛化的神经表示与渲染。(1) 视图Transformer利用多视图几何作为基于注意力的场景表示的归纳偏置,并通过聚合来自邻域视图上极线的信息来预测坐标对齐特征。(2) 光线Transformer在光线行进过程中沿采样点使用注意力解码视图Transformer的特征以渲染新视角。我们的实验表明,当在单一场景上优化时,由于学习到的光线渲染器,GNT无需显式渲染公式即可成功重建NeRF。当在多个场景上训练时,GNT在迁移至未见场景时持续达到最先进的性能,平均优于所有其他方法约10%。我们对学习到的注意力图推断深度与遮挡的分析表明,注意力使学习物理基础的渲染成为可能。我们的结果显示了Transformer作为图形通用建模工具的潜力。视频结果请参考我们的项目页面:https://vita-group.github.io/GNT/。

关键词

引用

@article{arxiv.2207.13298,
  title  = {Is Attention All That NeRF Needs?},
  author = {Mukund Varma T and Peihao Wang and Xuxi Chen and Tianlong Chen and Subhashini Venugopalan and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2207.13298},
  year   = {2023}
}

备注

International Conference on Learning Representations (ICLR), 2023