三维自由与三维先验结合:基于预训练扩散引导的单幅图像新颖视角合成
摘要
近期的三维新颖视角合成(NVS)方法通常需要大量的三维数据进行训练,而且通常缺乏对训练分布之外的泛化能力。此外,它们往往以物体为中心,难以处理复杂精细的场景。相反,三维自由(3D-free)方法可以利用预训练的稳定扩散模型生成复杂野外场景的文本控制视角,而无需大量基于三维的训练数据,但缺乏相机控制。在本文中,我们提出了一种方法,能够从单张输入图像生成相机控制视角,结合了三维自由和三维基于方法的优势。我们的方法在无需大量训练或额外三维和多视角数据的情况下,擅长处理复杂多样的场景。它利用广泛可用的预训练NVS模型进行弱指导,将这些知识整合到三维自由视角合成风格方法中,同时丰富CLIP视觉-语言空间以包含三维相机角度信息,从而实现所需结果。实验结果表明,我们的方法在定性和定量评估中均优于现有模型,在各种场景的所需相机角度下实现了高保真度、一致的新颖视角合成,同时在各种视角下保持了准确、自然细节的表征和图像清晰度。我们还通过全面分析二维图像生成模型和三维空间,为我们的解决方案提供了坚实的基础和理由。
引用
@article{arxiv.2408.06157,
title = {3D-free meets 3D priors: Novel View Synthesis from a Single Image with Pretrained Diffusion Guidance},
author = {Taewon Kang and Divya Kothandaraman and Dinesh Manocha and Ming C. Lin},
journal= {arXiv preprint arXiv:2408.06157},
year = {2025}
}
备注
Accepted to The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26), AAAI 2026 Workshop on AI for Environmental Science (AI4ES). Due to arXiv's 1,920-character limit, the abstract here is shortened. Please refer to the paper (View PDF) to read the full abstract. 14 pages, 13 figures, v5: AAAI-26 camera-ready version