CamFreeDiff:无摄像头图像到全景生成的扩散模型
计算机视觉与模式识别
2024-07-11 v1
摘要
本文提出 Camera-free Diffusion (CamFreeDiff) 模型,用于从单个无摄像头图像和文本描述生成 360 度图像填充。该方法与现有策略(如 MVDiffusion)不同,无需预定义摄像机姿态。我们的模型在多视角扩散框架中内置预测单应性的机制。我们方法的核心是通过预测从输入视角到预定义标准视角的单应性变换来构建相机估计。该单应性提供输入图像与目标全景图像之间的点级对应关系,允许通过对应感知注意力在完全可微的方式下进行连接。定性和定量实验结果表明,我们的模型在无摄像头输入的具有挑战性的背景下,具有强大的鲁棒性和泛化能力,用于 360 度图像填充。
引用
@article{arxiv.2407.07174,
title = {CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion Model},
author = {Xiaoding Yuan and Shitao Tang and Kejie Li and Alan Yuille and Peng Wang},
journal= {arXiv preprint arXiv:2407.07174},
year = {2024}
}