DiffDreamer:基于条件扩散模型的一致无监督单视图场景外推
计算机视觉与模式识别
2023-03-21 v2
摘要
场景外推——通过飞入给定图像来生成新视角的想法——是一项前景广阔却极具挑战的任务。对于每一预测帧,都必须解决一个联合修复与三维细化问题,该问题不适定且包含高度模糊性。此外,长距离场景的训练数据难以获取,且通常缺乏足够视角以推断准确的相机位姿。我们提出 DiffDreamer,一种无监督框架,能够合成描绘长相机轨迹的新视角,且仅在互联网收集的自然场景图像上训练。利用引导去噪步骤的随机性,我们训练扩散模型以细化投影的 RGBD 图像,但在推理时将去噪步骤条件于多个过去与未来帧。我们证明,图像条件扩散模型能有效进行长距离场景外推,且比先前的基于 GAN 的方法显著更好地保持一致性。DiffDreamer 是一种强大且高效的场景外推方案,在有限监督下仍能产生令人印象深刻的结果。项目主页:https://primecai.github.io/diffdreamer。
引用
@article{arxiv.2211.12131,
title = {DiffDreamer: Towards Consistent Unsupervised Single-view Scene Extrapolation with Conditional Diffusion Models},
author = {Shengqu Cai and Eric Ryan Chan and Songyou Peng and Mohamad Shahbazi and Anton Obukhov and Luc Van Gool and Gordon Wetzstein},
journal= {arXiv preprint arXiv:2211.12131},
year = {2023}
}