NVComposer: 利用多张稀疏无位姿图像提升生成式新视角合成
计算机视觉与模式识别
2024-12-09 v2
摘要
生成模型的最新进展显著提升了从多视角数据进行新视角合成(NVS)的能力。然而,现有方法依赖于外部多视角对齐过程,例如显式位姿估计或预重建,这限制了其灵活性和可访问性,尤其是在视角间重叠不足或存在遮挡导致对齐不稳定时。在本文中,我们提出NVComposer,一种无需显式外部对齐的新方法。NVComposer通过引入两个关键组件,使生成模型能够隐式推断多个条件视角之间的空间和几何关系:1) 一个图像-位姿双流扩散模型,可同时生成目标新视角和条件相机位姿;2) 一个几何感知特征对齐模块,在训练期间从密集立体模型中蒸馏几何先验。大量实验表明,NVComposer在生成式多视角NVS任务中达到了最先进的性能,消除了对外部对齐的依赖,从而提高了模型的可访问性。我们的方法在无位姿输入视图数量增加时,合成质量有显著提升,凸显了其在构建更灵活、更易访问的生成式NVS系统方面的潜力。我们的项目页面可在 https://lg-li.github.io/project/nvcomposer 获取。
引用
@article{arxiv.2412.03517,
title = {NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed Images},
author = {Lingen Li and Zhaoyang Zhang and Yaowei Li and Jiale Xu and Wenbo Hu and Xiaoyu Li and Weihao Cheng and Jinwei Gu and Tianfan Xue and Ying Shan},
journal= {arXiv preprint arXiv:2412.03517},
year = {2024}
}
备注
Project Page: https://lg-li.github.io/project/nvcomposer