从宽基线立体图像对学习渲染新视角
计算机视觉与模式识别
2023-04-18 v1 人工智能
摘要
我们提出了一种仅给定单张宽基线立体图像对的新视角合成方法。在这一具有挑战性的情形下,3D 场景点通常仅被观测一次,需要对场景几何与外观进行基于先验的重建。我们发现,现有的从稀疏观测进行新视角合成的方法由于恢复了错误的 3D 几何,以及由于可微渲染的高昂代价阻碍了其扩展到大规模训练而失败。我们朝解决这些缺陷迈出了一步:构建了一个多视角 transformer 编码器,提出了一种高效的、图像空间极线采样方案来为目标射线汇集图像特征,以及一种轻量的基于交叉注意力的渲染器。我们的贡献使得该方法能够在大规模真实世界室内外场景数据集上训练。我们证明我们的方法学到了强大的多视角几何先验,同时减少了渲染时间。我们在两个真实世界数据集的保留测试场景上进行了广泛对比,在基于稀疏图像观测的新视角合成上显著优于先前工作,并实现了多视角一致的新视角合成。
引用
@article{arxiv.2304.08463,
title = {Learning to Render Novel Views from Wide-Baseline Stereo Pairs},
author = {Yilun Du and Cameron Smith and Ayush Tewari and Vincent Sitzmann},
journal= {arXiv preprint arXiv:2304.08463},
year = {2023}
}
备注
CVPR 2023, Project Webpage: https://yilundu.github.io/wide_baseline/, Last Two Authors Equal Advising