中文

GLIMPSE:面向大型视觉语言模型的全程跨模态可解释性

计算机视觉与模式识别 2025-07-30 v3 人工智能

摘要

最近的大型视觉语言模型(LVLMs)在视觉问答(VQA)方面取得了显著进展。然而,解释LVLMs所关注的视觉注意力位置仍然是一个重要挑战,因而对于理解模型行为至关重要。我们提出GLIMPSE(Gradient-Layer Importance Mapping for Prompted Visual Saliency Explanation),即一种轻量级、模型无关的框架,能够联合归因LVLMs输出中最相关的视觉证据与支持开放式生成的文本信号。GLIMPSE融合梯度加权注意力、自适应层级传播与相关性加权词元聚合,生成用于解释跨模态推理的整体响应级热力图,在忠实性方面超越先前方法,并在人类注意力对齐方面推动了学术前沿。我们展示了一种解析方法,以揭示LVLMs跨模态归因的细粒度见解,追踪推理动力学,分析系统性误差,诊断幻觉与偏见,并确保透明度。

关键词

引用

@article{arxiv.2506.18985,
  title  = {GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models},
  author = {Guanxi Shen},
  journal= {arXiv preprint arXiv:2506.18985},
  year   = {2025}
}

备注

Keywords: Explainable Computer Vision, Large Vision-Language Models, AI Interpretability, Explainable AI, Visual Saliency, Attribution Maps, Cross-Modal Attribution, Human Attention Alignment, AI Transparency