中文

少数通道描绘全貌:揭示扩散Transformer中的海量激活

计算机视觉与模式识别 2026-05-15 v1 人工智能 多媒体

摘要

扩散Transformer(DiTs)及相关的基于流的架构现已成为最强大的文本到图像生成器之一,然而提示词塑造图像语义的内部机制仍知之甚少。在本工作中,我们研究了海量激活:一小部分隐藏状态通道,其响应持续远大于其余通道。我们表明,尽管它们具有稀疏性,但这少数通道在三个互补意义上有效地描绘了全貌。首先,它们在功能上至关重要:一种将海量通道置零的受控破坏探针会导致生成质量的急剧下降,而破坏同等数量的低统计量通道则影响甚微。其次,它们在空间上是有组织的:将图像流 token 限制在海量通道并对其进行聚类,可产生与主要主体和显著区域紧密对齐的连贯划分,揭示了隐藏在看似异常值子空间中的结构化空间编码。第三,它们是可迁移的:将海量激活从一个提示词条件的轨迹迁移到另一个轨迹中,会将最终图像向源提示词偏移,同时保留来自目标提示词的大量内容,从而产生局部语义插值而非无结构的像素混合。我们在两个用例中利用了这一特性:文本条件与图像条件的语义迁移,其中海量激活的迁移使得无需任何额外训练即可实现提示词插值与主体驱动生成。这些结果共同将海量激活重新定义为一种稀疏的、提示词条件的载流子子空间,而非激活异常,它在现代 DiT 模型中组织并控制语义信息。

关键词

引用

@article{arxiv.2605.13974,
  title  = {Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers},
  author = {Evelyn Turri and Davide Bucciarelli and Sara Sarto and Lorenzo Baraldi and Marcella Cornia},
  journal= {arXiv preprint arXiv:2605.13974},
  year   = {2026}
}

备注

Project page: https://aimagelab.github.io/MAs-DiT/