中文

权预测,误导解释:视觉语言模型解释机制的脆弱性

计算机视觉与模式识别 2026-05-19 v1 机器学习

摘要

解释机制越来越被用于支持视觉语言模型 (VLM) 的透明度和可信度,特别是在需要人工监督的决策情境中。然而,这些解释的鲁棒性仍不充分了解。本文调查了在对抗条件下,CLIP 基于模型的解释热图是否真实反映模型推理过程。我们展示了解释图可以被系统性操控而不改变模型原始预测,从而揭示了预测行为与解释忠诚度之间的断层。为研究此脆弱性,我们引入了X-Shift,这是一种新型灰箱攻击,通过扰动 patch 级视觉表示将解释热图引导至语义无关区域,而不改变预测输出。与旨在诱导误分类的常规对抗攻击不同,X-Shift 专门针对解释过程的完整性。该攻击无需修改模型参数,并可推广到多个 CLIP 架构和解释方法。我们在 ImageNet-1k、MS-COCO 和 Flickr30K 上评估了所提方法,证明在不可感知的扰动下,解释对齐性持续恶化,而预测稳定。此外,标准的预测导向对抗攻击即使在 substantially 更大的扰动预算下,也无法再现相同的解释转移行为。我们的发现凸显了当前 VLM 解释机制的根本局限,以及其在高影响应用中作为可靠模型可信度指示器的使用风险。

关键词

引用

@article{arxiv.2605.16651,
  title  = {Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations},
  author = {Narges Babadi and Hadis Karimipour},
  journal= {arXiv preprint arXiv:2605.16651},
  year   = {2026}
}