3D-Fixup:基于 3D 先验的照片编辑
计算机视觉与模式识别
2025-05-16 v1
摘要
尽管通过扩散模型对图像先验进行了显著进展,但 3D 导向的图像编辑仍然具有挑战性,这部分原因在于对象仅通过单张图像指定。为解决这一难题,我们提出了 3D-Fixup—a一种由学习的 3D 先验引导的编辑 2D 图像的新框架。该框架支持诸如对象平移和 3D 旋转等困难的编辑情境。为实现这一目标,我们采用一种基于训练的方法,利用扩散模型的生成能力。由于视频数据自然地编码了真实世界的物理动态,我们转向使用视频数据生成训练数据对,即源帧和目标帧。与仅依赖单个训练模型推断源帧和目标帧之间的转换不同,我们整合了来自 Image-to-3D 模型的 3D 引导,该模型通过显式地将 2D 信息投影到 3D 空间来桥接这一具有挑战性的任务。我们设计了一个数据生成管线,以确保训练期间的高质量 3D 引导。结果表明,通过整合这些 3D 先验,3D-Fixup 有效支持复杂且身份连贯的 3D 导向编辑,实现高质量结果,推动了扩散模型在真实图像操纵中的应用。代码已提供于 https://3dfixup.github.io/
引用
@article{arxiv.2505.10566,
title = {3D-Fixup: Advancing Photo Editing with 3D Priors},
author = {Yen-Chi Cheng and Krishna Kumar Singh and Jae Shin Yoon and Alex Schwing and Liangyan Gui and Matheus Gadelha and Paul Guerrero and Nanxuan Zhao},
journal= {arXiv preprint arXiv:2505.10566},
year = {2025}
}
备注
SIGGRAPH 2025. Project page: https://3dfixup.github.io/