探索对比语言-图像预训练的视觉可解释性
计算机视觉与模式识别
2022-11-29 v2
摘要
对比语言-图像预训练(CLIP)通过易获取的自然语言监督学习到丰富表示。它提升了下游视觉任务的性能,包括但不限于零样本、长尾、分割、检索、描述生成和视频。然而,CLIP的视觉可解释性很少被研究,尤其是针对原始特征图。为提供其预测的视觉解释,我们提出了图像-文本相似度图(ITSM)。基于此,我们惊讶地发现CLIP偏好背景区域甚于前景,并展现出违背人类理解的错误可视化结果。该现象在视觉变换器和卷积网络中均普遍存在,表明此问题具有独特性且非由特定网络引起。通过实验,我们发现问题出在池化部分,不恰当的池化方法导致了称为语义偏移的现象。针对该问题,我们提出了可解释对比语言-图像预训练(ECLIP),其通过掩码最大池化修正可解释性。具体而言,为避免语义偏移,我们将原始注意力池化替换为最大池化以聚焦于置信前景,并在训练期间借助自由注意力引导。在三个数据集上的实验表明,ECLIP大幅提升了CLIP的可解释性,且以显著优势超越先前可解释性方法。代码稍后发布。
引用
@article{arxiv.2209.07046,
title = {Exploring Visual Interpretability for Contrastive Language-Image Pre-training},
author = {Yi Li and Hualiang Wang and Yiqun Duan and Hang Xu and Xiaomeng Li},
journal= {arXiv preprint arXiv:2209.07046},
year = {2022}
}
备注
15 pages, 9 figures