视觉模型中的隐喻效应削弱注意力可解释性
计算机视觉与模式识别
2026-05-08 v1
摘要
基于部件的推理是使计算机视觉模型直接聚焦于与下游任务相关的对象部件的经典策略。在深度学习语境下,这也常用于通过基于部件的注意力机制提高可设计的可解释性,注意力机制基于标准黑盒模型提供的隐式图像表征。该方法基于局部假设:对象部件的隐式表征主要编码关于对应图像区域的信息。本文检验了这一基本假设,通过测量基于部件属性标注的视觉模型中的内部对象泄漏。我们通过全面实验评估,展示现代预训练视觉变换器违反局部假设,表现出强烈的内部对象泄漏,即每个部件编码来自整个对象的信息,一种视觉隐喻,削弱了基于注意力的按设计可解释方法的忠诚度,最终使其不可解释。此外,我们采用两阶段方法建立上界,通过设计防止泄漏。我们随后表明,这一本质上解耦的特征提取在多种任务上提高了基于属性的部件发现,确认了内部对象泄漏的实际影响。我们的结果揭示了影响基于部件表征可解释性的被忽视问题,包括依赖部件中心概念的 CBMs,凸显两阶段方法可作为缓解其前景。
引用
@article{arxiv.2605.06095,
title = {Metonymy in vision models undermines attention-based interpretability},
author = {Ananthu Aniraj and Cassio F. Dantas and Dino Ienco and Massimiliano Mancini and Diego Marcos},
journal= {arXiv preprint arXiv:2605.06095},
year = {2026}
}
备注
28 pages, preprint