修剪悖论:CLIP 最具信息量的注意力头如何提升性能并放大偏差
计算机视觉与模式识别
2025-09-22 v3 人工智能
摘要
CLIP 是最受欢迎的基础模型之一,被大量用于许多视觉-语言任务,但人们对其内部工作机制知之甚少。随着 CLIP 越来越多地被部署在实际应用中,理解其局限性和内嵌的社会偏差以减轻潜在的有害下游后果变得尤为关键。然而,究竟是什么内部机制驱动了 CLIP 令人印象深刻的能力以及有问题的缺陷,这个问题在很大程度上仍未得到解答。为了弥补这一空白,我们研究了类 CLIP 模型中注意力头的文本描述的概念一致性。具体而言,我们提出了概念一致性分数(CCS),这是一种新颖的可解释性指标,用于衡量 CLIP 模型中各个注意力头与特定概念的一致程度。我们的软剪枝实验表明,高 CCS 的注意力头对于保持模型性能至关重要,因为剪枝它们会导致比剪枝随机或低 CCS 的注意力头更大幅度的性能下降。值得注意的是,我们发现高 CCS 的注意力头捕获了核心概念,并在域外检测、特定概念推理和视频-语言理解中发挥着关键作用。此外,我们证明了高 CCS 的注意力头学习到了虚假相关性,从而放大了社会偏差。这些结果将 CCS 定位为一个强大的可解释性指标,揭示了 CLIP 模型中性能与社会偏差的悖论。
引用
@article{arxiv.2503.11103,
title = {Pruning the Paradox: How CLIP's Most Informative Heads Enhance Performance While Amplifying Bias},
author = {Avinash Madasu and Vasudev Lal and Phillip Howard},
journal= {arXiv preprint arXiv:2503.11103},
year = {2025}
}