细察对比语言-图像预训练的可解释性
计算机视觉与模式识别
2024-09-17 v2
摘要
对比语言-图像预训练(CLIP)是一种强大的视觉-语言模型,已在多种任务中展现出巨大优势。然而,我们发现了其可解释性方面的一些问题,这些问题削弱了其可信度并限制了相关任务的能力。具体而言,我们发现 CLIP 倾向于关注背景区域而非前景,在可视化结果的不相关位置出现噪声激活。这些现象与基于类注意力图(CAM)的传统可解释性方法相矛盾,后者中原始模型可在无对齐的全局监督下突出局部前景区域。为解决这些问题,我们仔细审视其架构与特征。基于透彻的分析,我们发现原始自注意力关联到不一致的语义区域,导致了相反的可视化结果。此外,噪声激活源于类别间的冗余特征。基于这些见解,我们提出了用于可靠 CAM 的 CLIP Surgery 方法,该方法允许对推理架构和特征进行类似手术的修改,而无需像经典 CAM 方法那样进一步微调。该方法显著提升了 CLIP 的可解释性,大幅超越现有方法。此外,它实现了多模态可视化,并在无额外对齐的情况下扩展了原始 CLIP 在开放词汇任务上的能力。代码见 https://github.com/xmed-lab/CLIP_Surgery。
引用
@article{arxiv.2304.05653,
title = {A Closer Look at the Explainability of Contrastive Language-Image Pre-training},
author = {Yi Li and Hualiang Wang and Yiqun Duan and Jiheng Zhang and Xiaomeng Li},
journal= {arXiv preprint arXiv:2304.05653},
year = {2024}
}
备注
30 pages, 11 figures, under review