基于注意力头的大型视觉语言模型图像到文本信息流解释
计算机视觉与模式识别
2025-09-23 v1 人工智能
机器学习
摘要
大型视觉语言模型 (LVLMs) 通过一系列注意力头将图像信息传递到文本中, 以回答视觉问题. 尽管这种图像到文本的信息流是视觉问答的核心, 但其背后的机制仍然难以解释, 因为众多注意力头的同时作用. 为解决此挑战, 我们提出了 head attribution 技术, 灵感来自组件 attribution 方法, 以识别在信息传递中发挥关键作用的注意力头的一致模式. 通过 head attribution, 我们研究了 LVLMs 如何依赖于特定注意力头来识别和回答关于图像中主对象的问题. 我们的分析揭示, 存在一小部分注意力头促进了图像到文本的信息流. 令人惊讶的是, 我们发现这些注意力头的选择由输入图像的语义内容而非其视觉外观所决定. 我们进一步 examination 信息在 token 级别的流动, 并发现 (1) 文本信息首先传递到与角色相关的 token 和最终 token, 然后接收图像信息; (2) 图像信息嵌入在与对象相关和背景 token 中. 我们的工作提供了证据, 表明图像到文本的信息流遵循结构化过程, 且注意力头层面的分析为理解 LVLMs 的机制提供了前景的方向.
引用
@article{arxiv.2509.17588,
title = {Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models},
author = {Jinyeong Kim and Seil Kang and Jiwoo Park and Junhyeok Kim and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2509.17588},
year = {2025}
}