扩散模型作为几何批评者:利用预训练扩散先验进行单图像三维编辑
计算机视觉与模式识别
2024-07-16 v2
摘要
我们提出一种新颖的图像编辑技术,能够在单张图像上实现三维操作,例如物体旋转与平移。现有的三维感知图像编辑方法通常依赖合成的多视图数据集来训练专用模型,这限制了它们在布局和风格变化更为丰富的开放域图像上的有效性。相比之下,我们的方法直接利用在广泛文本-图像对上训练的强大图像扩散模型,从而保留了其卓越的泛化能力。这一目标通过开发一种迭代式新视图合成与几何对齐算法来实现。该算法利用扩散模型实现双重目的:它们通过使用估计的深度图预测选定物体的新视图来提供外观先验,并作为几何批评者,通过校正采样视图间三维形状的错位来发挥作用。我们的方法能够生成具有大视角变换以及与输入图像高度外观和形状一致性的高质量三维感知图像编辑,突破了单图像三维感知编辑的现有边界。
引用
@article{arxiv.2403.11503,
title = {Diffusion Models are Geometry Critics: Single Image 3D Editing Using Pre-Trained Diffusion Priors},
author = {Ruicheng Wang and Jianfeng Xiang and Jiaolong Yang and Xin Tong},
journal= {arXiv preprint arXiv:2403.11503},
year = {2024}
}
备注
Project page: https://wangrc.site/Diff3DEdit/