VLMS的注意力是什么?面向高斯噪声自由文本图像损坏与评估的机理解释管道
计算与语言
2025-05-16 v3
摘要
视觉语言模型(VLMs)因能够整合视觉和文本输入以执行复杂任务而在社区范围内获得显著流行。尽管取得了成功,但这些模型的内部决策过程仍然是黑箱,给高风险应用提出了挑战。为此,我们引入NOTICE,即VLMs机理解释领域的首个无噪声文本图像损坏与评估管道。NOTICE集成了语义最小配对(SMP)框架用于图像损坏以及对称标记替换(STR)用于文本。该方法为两种模态提供语义上有意义的因果中介分析,为模型如BLIP中的多模态集成提供稳健的方法。我们在SVO-Probes、MIT-States和面部表情识别数据集上的实验揭示了VLMs决策过程的关键见解,识别出中间层跨注意力头在决策中的重要作用。进一步,我们发现了一组在任务和模态之间始终贡献的“通用跨注意力头”,这些头各自执行 distinct 功能,如隐式图像分割、对象抑制和离群点抑制。这一工作为更透明和可解释的多模态系统铺平了道路。
引用
@article{arxiv.2406.16320,
title = {What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and Evaluation},
author = {Michal Golovanevsky and William Rudman and Vedant Palit and Ritambhara Singh and Carsten Eickhoff},
journal= {arXiv preprint arXiv:2406.16320},
year = {2025}
}