解决基于扩散模型的图像编辑中的文本嵌入泄露问题
计算机视觉与模式识别
2025-08-26 v4
摘要
基于生成扩散模型的文本驱动图像编辑使用户能够通过自然语言提示修改图像,极大简化了传统工作流。尽管取得了这些进展,当前方法仍存在一个关键问题:属性泄露,即针对特定对象的编辑无意中影响了不相关区域或其他目标对象。我们的分析揭示了根本原因在于自回归文本编码器生成的序列结束(EOS)嵌入中固有的语义纠缠,这些嵌入不加区分地聚合提示中的属性。为解决此问题,我们提出了属性无泄露编辑(ALE)框架,从源头解决属性泄露问题。ALE结合了对象受限嵌入(ORE)以解耦文本嵌入、用于空间精确注意力的区域引导混合交叉注意力掩码(RGB-CAM),以及背景混合(BB)以保留非编辑内容。为定量评估各种编辑方法中的属性泄露,我们提出了属性泄露评估基准(ALE-Bench),包含全面的编辑场景和新指标。大量实验表明,ALE大幅降低了属性泄露,从而实现准确的多对象文本驱动图像编辑,同时忠实保留非目标内容。
引用
@article{arxiv.2412.04715,
title = {Addressing Text Embedding Leakage in Diffusion-based Image Editing},
author = {Sunung Mun and Jinhwan Nam and Sunghyun Cho and Jungseul Ok},
journal= {arXiv preprint arXiv:2412.04715},
year = {2025}
}
备注
Accepted to ICCV 2025