Debiasing CLIP:解读与纠正注意力头中的偏见
计算机视觉与模式识别
2025-05-26 v1 计算与语言
摘要
多模态模型如 CLIP 因其在各种任务上的卓越零样本性能而受到广泛关注。然而,研究发现 CLIP 可能无意中学习到目标变量与干扰因素之间的伪关联。为此,我们引入了 Locate-Then-Correct (LTC),一种对比框架,通过机理洞察识别视觉Transformer中的伪注意力头,并通过有针对性的消失来加以缓解。此外,LTC 识别具有任务相关性的注意力头,通过正交投影集成判别特征以提升分类性能。我们在具有天然背景偏见和性别偏见的基准测试上评估了 LTC,相较于非训练后处理基线方法,最差组准确率提升超过 50%。此外,我们可视化了所选注意力头的表示,并发现所呈现的解释与识别伪注意力头和关键注意力头的对比机制相吻合。代码已公开于 https://github.com/wj210/CLIP_LTC。
关键词
引用
@article{arxiv.2505.17425,
title = {Debiasing CLIP: Interpreting and Correcting Bias in Attention Heads},
author = {Wei Jie Yeo and Rui Mao and Moloud Abdar and Erik Cambria and Ranjan Satapathy},
journal= {arXiv preprint arXiv:2505.17425},
year = {2025}
}
备注
Under review