中文

请注意!PixelSHAP揭示视觉语言模型实际关注的内容

计算机视觉与模式识别 2025-03-11 v1 计算与语言

摘要

视觉语言模型的可解释性对于高风险应用中的信任、调试和决策至关重要。我们提出了 PixelSHAP,这是一个将基于 Shapley 的分析扩展到结构化视觉实体的模型无关框架。与以往专注于文本提示的方法不同,PixelSHAP 通过系统地扰动图像对象并量化其对 VLM 响应的影响,适用于基于视觉的推理。PixelSHAP 无需模型内部信息,仅基于输入-输出对运行,使其兼容开源和商业模型。它支持多种基于嵌入的相似性度量,并使用受基于 Shapley 方法启发的优化技术进行高效扩展。我们在自动驾驶中验证了 PixelSHAP,突出了其增强可解释性的能力。关键挑战包括分割敏感性和对象遮挡。我们的开源实现促进了进一步的研究。

关键词

引用

@article{arxiv.2503.06670,
  title  = {Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On},
  author = {Roni Goldshmidt},
  journal= {arXiv preprint arXiv:2503.06670},
  year   = {2025}
}