无位姿可泛化渲染Transformer
计算机视觉与模式识别
2023-12-29 v3
摘要
在新视角合成领域,渲染前已知相机位姿(例如通过运动恢复结构)是一种常见做法。然而,持续获取准确的相机位姿仍具挑战,且位姿提取中的误差会对视角合成过程产生不利影响。为应对这一挑战,我们提出 PF-GRT,一种新颖的无位姿(Pose-Free)可泛化渲染Transformer框架,它消除了对预计算相机位姿的依赖,转而利用直接从数据中学习到的特征匹配。PF-GRT 采用局部相对坐标系进行参数化,其中一幅源图像被设为原点。我们设计了 OmniView Transformer,用于在无位姿设定下融合多视角线索,执行无位姿视角融合与以原点为中心的聚合。目标光线上的三维点特征通过投影到选定的原点平面进行采样。最终像素强度由另一个 Transformer 进行调制与解码。PF-GRT 展现出在训练阶段未见过的新场景上令人印象深刻的泛化能力,且无需预计算相机位姿。我们在 LLFF、RealEstate-10k、Shiny 和 Blender 数据集上的零样本渲染实验表明,它能生成更高质量的照片级真实感图像。此外,它对测试相机位姿中的噪声表现出鲁棒性。代码见 https://zhiwenfan.github.io/PF-GRT/。
引用
@article{arxiv.2310.03704,
title = {Pose-Free Generalizable Rendering Transformer},
author = {Zhiwen Fan and Panwang Pan and Peihao Wang and Yifan Jiang and Hanwen Jiang and Dejia Xu and Zehao Zhu and Dilin Wang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2310.03704},
year = {2023}
}