中文

ViewFormer:基于Transformer的少视图免NeRF神经渲染

计算机视觉与模式识别 2022-07-22 v2 机器学习

摘要

新视角合成是一个长期存在的问题。在这项工作中,我们考虑该问题的一个变体,即仅给定稀疏覆盖场景或物体的少量上下文视图。目标是预测场景中的新视点,这需要学习先验知识。当前最先进的方法基于神经辐射场(NeRF),虽然取得了令人印象深刻的结果,但这些方法训练时间长,因为它们需要为每张图像通过神经网络评估数百万个3D点样本。我们提出了一种仅2D的方法,通过神经网络单次传递将多个上下文视图和一个查询位姿映射到新图像。我们的模型使用由码本和Transformer模型组成的两阶段架构。码本用于将单个图像嵌入到较小的潜在空间,而Transformer在这个更紧凑的空间中解决视图合成任务。为了高效训练我们的模型,我们引入了一种新颖的分支注意力机制,使我们能够使用同一模型不仅进行神经渲染,还用于相机位姿估计。在真实场景上的实验结果表明,我们的方法在不显式进行3D推理的情况下与基于NeRF的方法相比具有竞争力,并且训练速度更快。

关键词

引用

@article{arxiv.2203.10157,
  title  = {ViewFormer: NeRF-free Neural Rendering from Few Images Using Transformers},
  author = {Jonáš Kulhánek and Erik Derner and Torsten Sattler and Robert Babuška},
  journal= {arXiv preprint arXiv:2203.10157},
  year   = {2022}
}

备注

ECCV 2022 poster