通过统一潜在扩散模型实现无需调参的图像编辑:兼顾保真度与可编辑性
计算机视觉与模式识别
2025-04-09 v1
摘要
在基于文本的图像编辑(TIE)中,保真度与可编辑性的平衡至关重要,常见问题包括过度编辑或不足编辑。现有方法通常依赖注意力注入实现结构保持,借助预训练文本到图像(T2I)模型的内在文本对齐能力提升可编辑性,但缺乏统一且明确的机制来正确平衡这两个目标。本文引入UnifyEdit,一种无需调参的方法,通过扩散潜在优化实现保真度与可编辑性在统一框架内的平衡。不同于直接注意力注入,我们开发了两种基于注意力的约束:用于结构保真度的自注意力(SA)保持约束,以及增强文本对齐以提升可编辑性的交叉注意力(CA)对齐约束。然而,同时应用两种约束可能导致梯度冲突,单一约束的主导会引发过度或不足编辑。为解决此问题,本文引入自适应时间步调度器,动态调整约束影响,引导扩散潜在导向最佳平衡。广泛的定量与定性实验验证了方法的有效性,表明其在实现结构保持与文本对齐之间的稳健平衡方面优于其他最先进方法。源代码将公开于https://github.com/CUC-MIPG/UnifyEdit。
引用
@article{arxiv.2504.05594,
title = {Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model},
author = {Qi Mao and Lan Chen and Yuchao Gu and Mike Zheng Shou and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2504.05594},
year = {2025}
}
备注
under review