中文

扩散变换器中的注意力沉底:因果分析

计算机视觉与模式识别 2026-05-13 v2

摘要

注意力沉底——即获得不成比例注意力质量的令牌——被假设在自回归语言模型中具有重要功能,但其在扩散变换器中的作用尚不明确。我们对文本到图像扩散进行因果分析,动态识别每个时间步的主要注意力接受者,并通过在评分路径和值路径上的配对、训练-free干预来抑制它们。在Stable Diffusion~3上进行553个GenEval提示的实验(并以SDXL为验证),结果表明删除这些沉底不会降低文本-图像对齐(CLIP-T)或偏好代理指标(ImageReward, HPS-v2)在k=1时;仅在更强的干预下(k≥10)时,HPS-v2才表现出度量依赖的边界,而CLIP-T在整个过程中保持稳健。尽管如此,抑制导致的感知变化仍是特定于沉底的——约为等预算随机遮蔽的6倍——揭示了扩散变换器中轨迹级扰动与语义对齐之间的实证性dissociation。footnote{代码可在https://github.com/wfz666/ICML26-attention-sink/获取}。

关键词

引用

@article{arxiv.2605.09313,
  title  = {Attention Sinks in Diffusion Transformers: A Causal Analysis},
  author = {Fangzheng Wu and Brian Summa},
  journal= {arXiv preprint arXiv:2605.09313},
  year   = {2026}
}