DiffEditor:提升基于扩散的图像编辑的准确性与灵活性
计算机视觉与模式识别
2024-02-06 v1 机器学习
摘要
大规模文本到图像 (T2I) 扩散模型在过去几年中彻底改变了图像生成。尽管拥有多样化和高质量的生成能力,但将这些能力转化为细粒度图像编辑仍然具有挑战性。在本文中,我们提出 DiffEditor 以纠正现有基于扩散的图像编辑中的两个弱点:(1) 在复杂场景中,编辑结果往往缺乏编辑准确性并表现出意外的伪影;(2) 缺乏协调编辑操作(例如想象新内容)的灵活性。在我们的解决方案中,我们在细粒度图像编辑中引入图像提示,与文本提示合作以更好地描述编辑内容。为了在保持内容一致性的同时增加灵活性,我们将随机微分方程 (SDE) 局部结合到常微分方程 (ODE) 采样中。此外,我们将基于区域的得分梯度引导和时间旅行策略纳入扩散采样,进一步提高编辑质量。大量实验表明,我们的方法可以在各种细粒度图像编辑任务上高效地实现最先进 (SOTA) 的性能,包括单图像内的编辑(例如物体移动、调整大小和内容拖拽)以及跨图像的编辑(例如外观替换和物体粘贴)。我们的源代码发布在 https://github.com/MC-E/DragonDiffusion。
引用
@article{arxiv.2402.02583,
title = {DiffEditor: Boosting Accuracy and Flexibility on Diffusion-based Image Editing},
author = {Chong Mou and Xintao Wang and Jiechong Song and Ying Shan and Jian Zhang},
journal= {arXiv preprint arXiv:2402.02583},
year = {2024}
}