FIA-Edit:基于频率交互注意力的高保真无潜在 inversions 文本引导图像编辑
计算机视觉与模式识别
2025-11-18 v1
摘要
随着扩散模型的兴起,文本引导图像编辑取得了快速进展。虽然基于流的无潜在 inversions 方法通过避免潜在空间的反转操作实现了高效,但往往难以有效整合源信息,导致背景保真性差、空间不一致性强以及过度编辑。为此,本文提出了FIA-Edit,一种新型无潜在 inversions 框架,通过频率交互注意力(Frequency-Interactive Attention)实现高保真和语义精确的编辑。具体而言,我们设计了两个关键组件:(1)频率表示交互(FRI)模块,通过在自注意力机制中在源特征和目标特征之间交换频率成分,以增强跨域对齐;(2)特征注入(FIJ)模块,显式地将源端的查询、键、值以及文本嵌入注入目标分支的交叉注意力中,以保留结构和语义。广泛而深入的实验表明,FIA-Edit在低计算成本下(约6秒处理512×512尺寸的图像)支持高保真编辑,始终优于现有方法在视觉质量、背景保真性和可控性方面的表现。此外,我们首次将文本引导图像编辑扩展至临床应用。通过合成解剖学连贯的出血变化,FIA-Edit为医疗数据增强提供了新的机会,并在下游出血分类任务中取得显著提升。项目地址:https://github.com/kk42yy/FIA-Edit
引用
@article{arxiv.2511.12151,
title = {FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing},
author = {Kaixiang Yang and Boyang Shen and Xin Li and Yuchen Dai and Yuxuan Luo and Yueran Ma and Wei Fang and Qiang Li and Zhiwei Wang},
journal= {arXiv preprint arXiv:2511.12151},
year = {2025}
}
备注
AAAI 2026