跨层转码器能否取代视觉 Transformer 激活?从可解释性角度看视觉
计算机视觉与模式识别
2026-04-16 v1 人工智能
摘要
理解视觉 Transformer (ViT) 内部激活对于构建可解释且可信赖的模型至关重要。虽然已有稀疏自编码器 (SAEs) 用于提取人类可解释特征,但它们仅针对单个层,无法捕捉 Transformer 的跨层计算结构,亦无法揭示每一层在构建最终层表示中的相对重要性。或者,我们引入跨层转码器 (CLTs) 作为 ViT 中 MLP 模块可靠、稀疏且深度感知的代理模型。CLTs 使用编码器-解码器结构,从学习的稀疏嵌入重构每个 post-MLP 激活,实现从不透明嵌入到加法、层级解析构建的转换,使最终表示能够实现忠实的归因和过程级可解释性。我们在 CLIP ViT-B/32 和 ViT-B/16 上训练 CLTs,分别用于 CIFAR-100、COCO 和 ImageNet-100。我们表明 CLTs 在保持 post-MLP 激活重构保真度的同时,甚至在某些情况下还能提高 CLIP zero-shot 分类准确率。就可解释性而言,我们表明跨层贡献得分提供了忠实的归因,揭示最终表示集中于一小部分占主导地位的层级项,其移除会降低性能,而其保留则大体保持性能。这些结果彰显了 CLTs 作为视觉领域可替代 ViT 可解释代理的重要性。
引用
@article{arxiv.2604.13304,
title = {Can Cross-Layer Transcoders Replace Vision Transformer Activations? An Interpretable Perspective on Vision},
author = {Gerasimos Chatzoudis and Konstantinos D. Polyzos and Zhuowei Li and Difei Gu and Gemma E. Moran and Hao Wang and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2604.13304},
year = {2026}
}