面向无训练图像编辑控制的扩散 Transformer 双通道注意力引导
计算机视觉与模式识别
2026-02-26 v2 人工智能
摘要
面向扩散基图像编辑模型(基于 Diffusion Transformer, DiT 架构构建)的无训练编辑强度控制是一项关键需求。现有注意力操控方法仅针对 Key 空间进行调制,以影响注意力路由,完全未利用主导特征聚合的 Value 空间。本文首先揭示 DiT 多模态注意力层中的 Key 与 Value 投影均呈现显著的偏置-δ 结构,即 token 嵌入紧密聚集于特定层的偏置向量周围。基于此观察,我们提出双通道注意力引导 (Dual-Channel Attention Guidance, DCAG) 框架,同时操控 Key 通道(控制注意力位置)和 Value 通道(控制特征聚合)。我们提供理论分析表明,Key 通道通过非线性 softmax 函数起到粗调节作用,而 Value 通道通过线性加权求和起到细粒度补充作用。两维参数空间 实现了比单通道方法更精确的编辑保真度权衡。在包含 700 张图片、10 类编辑类别的 PIE-Bench 框架上,实验表明 DCAG 在所有保真度指标上均优于仅使用 Key 的引导方法,其中在局部编辑任务(如对象删除降低 4.9% LPIPS,对象添加降低 3.2% LPIPS)中获得显著提升。
引用
@article{arxiv.2602.18022,
title = {Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers},
author = {Guandong Li},
journal= {arXiv preprint arXiv:2602.18022},
year = {2026}
}