FusionEdit: 语义融合与注意力调制实现免训练图像编辑
计算机视觉与模式识别
2026-02-10 v1
摘要
文本引导的图像编辑旨在根据目标提示修改特定区域,同时保留源图像的身份信息。近期方法利用显式二值掩码来约束编辑,但硬掩码边界会引入伪影并降低可编辑性。为解决这些问题,我们提出FusionEdit,一种免训练的图像编辑框架,能够实现精确且可控的编辑。首先,通过测量源提示与目标提示之间的语义差异,自动识别编辑区域和保留区域。为缓解边界伪影,FusionEdit沿区域边界执行距离感知的潜在融合,以生成柔和且精确的掩码,并采用全变分损失来强制平滑过渡,从而获得自然的编辑结果。其次,FusionEdit在DiT注意力层内利用基于AdaIN的调制,在编辑区域执行统计注意力融合,在增强可编辑性的同时保持与源图像的全局一致性。大量实验表明,我们的FusionEdit显著优于现有最先进方法。代码可在\href{https://github.com/Yvan1001/FusionEdit}{https://github.com/Yvan1001/FusionEdit}获取。
引用
@article{arxiv.2602.08725,
title = {FusionEdit: Semantic Fusion and Attention Modulation for Training-Free Image Editing},
author = {Yongwen Lai and Chaoqun Wang and Shaobo Min},
journal= {arXiv preprint arXiv:2602.08725},
year = {2026}
}
备注
Accepted by ICASSP 2026