别忘了图像编辑中的逆向 DDIM
计算机视觉与模式识别
2025-07-16 v1
摘要
文本到图像生成领域因扩散模型的引入而取得了显著进展。然而,编辑实际图像的挑战仍然存在,因为大多数方法要么计算代价高,要么产生差励的重构。本文引入了 SAGE (Self-Attention Guidance for image Editing) - 一种新型技术,利用预训练扩散模型进行图像编辑。SAGE 基于 DDIM 算法, Incorporates 一种 novel guidance mechanism, 利用扩散 U-Net 的自注意力层计算一种基于逆 DDIM过程中生成的注意力图的重构目标,从而在无需精确重构整个输入图像的情况下,高效重构未编辑区域。因此,SAGE 直接解决了图像编辑中的关键挑战。通过定量和定性评估以及经统计学验证的全面用户研究,证明了 SAGE 在其他方法中的优势。在 10 项定量分析中,SAGE 以七项第一名成绩,另外三项中分别位列第二和第三。
引用
@article{arxiv.2505.09571,
title = {Don't Forget your Inverse DDIM for Image Editing},
author = {Guillermo Gomez-Trenado and Pablo Mesejo and Oscar Cordón and Stéphane Lathuilière},
journal= {arXiv preprint arXiv:2505.09571},
year = {2025}
}
备注
12 pages, 12 figures, code available at https://guillermogotre.github.io/sage/