中文

DEX-AR:面向自回归视觉语言模型的动态解释方法

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

随着视觉语言模型(VLM)日益复杂且广泛应用,越来越重要的是理解其决策过程。传统解释方法针对分类任务设计,难以应对现代自回归 VLM 由于其复杂的逐 token 生成过程和视觉与文本模态之间的复杂交互。我们提出 DEX-AR(Dynamic Explainability for AutoRegressive models),一种新型解释方法,旨�应对这些挑战,通过生成每个 token 和序列级别的 2D 热力图,突出模型文本响应中关键图像区域。该方法通过计算逐 token 生成过程中注意力图相对于各层梯度,来解释自回归 VLM——包括各层和生成 token 的重要性差异。DEX-AR 引入了两个关键创新:一种动态头筛选机制识别专注于视觉信息的注意力头,以及一种序列级筛选方法在聚合每个 token 的解释时区分视觉 grounding 与纯语言 token。我们在 ImageNet、VQAv2 和 PascalVOC 上进行评估,结果显示该方法在使用新颖的归一化 perplexity 测度的扰动基准以及分段基准方面均实现了一致的改进。

关键词

引用

@article{arxiv.2603.06302,
  title  = {DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models},
  author = {Walid Bousselham and Angie Boggust and Hendrik Strobelt and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2603.06302},
  year   = {2026}
}

备注

Project page: https://walidbousselham.com/DEX-AR