场景表示变换器:基于集合隐场景表示的无几何新视角合成
计算机视觉与模式识别
2022-03-30 v3 人工智能
图形学
机器学习
机器人学
摘要
计算机视觉中的一个经典问题是从少量图像推断出一个 3D 场景表示,并可用于以交互速率渲染新视角。先前的工作侧重于重建预定义的 3D 表示(如带纹理网格)或隐式表示(如辐射场),且常需要具有精确相机位姿的输入图像以及针对每个新场景较长的处理时间。在本工作中,我们提出场景表示变换器(SRT),一种处理新区域的有位姿或无位姿 RGB 图像、推断“集合隐场景表示”并合成新视角的方法,全部在单次前馈过程中完成。为计算场景表示,我们提出将 Vision Transformer 推广至图像集合,实现全局信息整合,从而进行 3D 推理。一个高效的解码器变换器通过关注场景表示来参数化光场以渲染新视角。学习通过最小化新视角重建误差进行端到端监督。我们表明该方法在合成数据集(包括为本文创建的新数据集)上以 PSNR 和速度优于近期基线。此外,我们证明 SRT 可扩展以支持利用 Street View 图像对真实世界户外环境进行交互式可视化和语义分割。
引用
@article{arxiv.2111.13152,
title = {Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene Representations},
author = {Mehdi S. M. Sajjadi and Henning Meyer and Etienne Pot and Urs Bergmann and Klaus Greff and Noha Radwan and Suhani Vora and Mario Lucic and Daniel Duckworth and Alexey Dosovitskiy and Jakob Uszkoreit and Thomas Funkhouser and Andrea Tagliasacchi},
journal= {arXiv preprint arXiv:2111.13152},
year = {2022}
}
备注
Accepted to CVPR 2022, Project website: https://srt-paper.github.io/