中文

基于Transformer的序列视图合成

计算机视觉与模式识别 2020-09-23 v2 机器学习 图像与视频处理

摘要

本文通过神经渲染解决新视角合成问题,其中我们致力于基于其他视角给定的一组输入图像,在任意相机位姿下预测新视角。利用已知的查询位姿与输入位姿,我们创建一组导向目标视图的有序观测。因此,单张新视角合成问题被重构为序列视图预测任务。本文提出的基于Transformer的生成式查询网络(T-GQN)通过引入两个新概念扩展了神经渲染方法。首先,我们在上下文图像间使用多视角注意力学习以获得多个隐式场景表示。其次,我们引入一个序列渲染解码器,基于所学表示预测包括目标视图在内的图像序列。最后,我们在多个具挑战性的数据集上评估了我们的模型,并证明我们的模型不仅给出一致的预测,且无需任何重新训练来进行微调。

关键词

引用

@article{arxiv.2004.04548,
  title  = {Sequential View Synthesis with Transformer},
  author = {Phong Nguyen-Ha and Lam Huynh and Esa Rahtu and Janne Heikkila},
  journal= {arXiv preprint arXiv:2004.04548},
  year   = {2020}
}

备注

Code is available at: https://github.com/phongnhhn92/TransformerGQN; Supplementary material: https://bit.ly/3kEgnzU