中文

解码视觉 Transformer:扩散驾驶镜头

计算机视觉与模式识别 2025-04-24 v2 人工智能

摘要

Logit Lens 是一种广泛用于 transformer-based 语言模型机制解释的方法,使我们能够通过将其投射到输出词汇表空间来分析内部表示在各层中的演化。虽然将 Logit Lens 应用于视觉 Transformer(ViT)在技术上是直接的,但其直接使用面临捕捉视觉表示丰富性的局限。建立在 Toker 等人 (2024) 的工作基础上,该工作引入了 Diffusion Lens 来可视化 text-to-image 扩散模型中 text 编码器的中间表示,我们演示了虽然 Diffusion Lens 可以有效地可视化 image 编码器中的残差流表示,但无法捕捉 individual submodules 的直接贡献。为克服这一局限,我们提出了一种 novel、基于训练的 Diffusion Steering Lens(DSL),该方法驾驭 submodule 输出并影响后续的间接贡献。我们通过干预研究验证了该方法,表明 DSL 提供了对 ViT 内部处理的直观且可靠的解释。

关键词

引用

@article{arxiv.2504.13763,
  title  = {Decoding Vision Transformers: the Diffusion Steering Lens},
  author = {Ryota Takatsuki and Sonia Joseph and Ippei Fujisawa and Ryota Kanai},
  journal= {arXiv preprint arXiv:2504.13763},
  year   = {2025}
}

备注

12 pages, 17 figures. Accepted to the CVPR 2025 Workshop on Mechanistic Interpretability for Vision (MIV)