无几何视图合成:Transformer 且无需 3D 先验
计算机视觉与模式识别
2021-08-31 v2
摘要
从单张图像合成新视图是否需要几何模型?受限于局部卷积,CNN 需要显式的 3D 偏置来建模几何变换。相反,我们证明基于 transformer 的模型可以在没有任何手工设计的 3D 偏置的情况下合成全新的视图。这通过以下方式实现:(i)用于隐式学习源视图与目标视图之间长程 3D 对应关系的全局注意力机制,以及(ii)捕捉从单张图像预测新视图所固有模糊性所必需的概率公式,从而克服了先前方法局限于相对较小视角变化的限制。我们评估了将 3D 先验整合进 transformer 架构的各种方式。然而,我们的实验表明不需要此类几何先验,且 transformer 能够隐式学习图像间的 3D 关系。此外,该方法在视觉质量上优于最先进水平(SOTA),同时覆盖了可能实现的全部分布。代码可在 https://git.io/JOnwn 获取。
引用
@article{arxiv.2104.07652,
title = {Geometry-Free View Synthesis: Transformers and no 3D Priors},
author = {Robin Rombach and Patrick Esser and Björn Ommer},
journal= {arXiv preprint arXiv:2104.07652},
year = {2021}
}
备注
Published at ICCV 2021. Code available at https://git.io/JOnwn