中文

用于提升扩散模型图像可编辑性的源提示解耦反演

计算机视觉与模式识别 2024-07-08 v2

摘要

文本驱动的扩散模型通过使用文本提示作为输入,显著提升了图像编辑性能。文本驱动图像编辑的一个关键步骤是将原始图像反演为以源提示为条件的潜在噪声码。尽管以往方法通过重构图像合成过程取得了可喜的成果,但反演得到的潜在噪声码与源提示紧密耦合,限制了目标文本提示对图像的可编辑性。为解决这一问题,我们提出了一种名为源提示解耦反演(SPDInv)的新方法,旨在减少源提示的影响,从而利用扩散模型增强文本驱动的图像编辑性能。为使反演噪声码尽可能独立于给定的源提示,我们指出迭代反演过程应满足不动点约束。因此,我们将反演问题转化为寻找不动点解的搜索问题,并利用预训练的扩散模型来促进搜索过程。实验结果表明,我们提出的 SPDInv 方法能有效缓解目标编辑提示与源提示之间的冲突,显著减少编辑伪影。除文本驱动的图像编辑外,借助 SPDInv,我们可以轻松地将定制的图像生成模型适配到局部编辑任务中,并产生有前景的性能。源代码可在 https://github.com/leeruibin/SPDInv 获取。

关键词

引用

@article{arxiv.2403.11105,
  title  = {Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion Models},
  author = {Ruibin Li and Ruihuang Li and Song Guo and Lei Zhang},
  journal= {arXiv preprint arXiv:2403.11105},
  year   = {2024}
}