FairerCLIP:利用再生核希尔伯特空间中的函数消除CLIP零样本预测偏差
计算机视觉与模式识别
2024-05-20 v2 机器学习
摘要
大型预训练视觉-语言模型(如CLIP)提供了紧凑且通用的文本和图像表示,这些表示在多个下游零样本预测任务中表现出显著的有效性。然而,由于其训练过程的性质,这些模型有可能1)传播或放大训练数据中的社会偏见,以及2)学会依赖伪特征。本文提出了FairerCLIP,这是一种使CLIP的零样本预测更公平且对伪相关更鲁棒的通用方法。我们在再生核希尔伯特空间(RKHSs)中构建了联合消除CLIP图像和文本表示偏差的问题,这带来了多重好处:1)灵活性:与现有方法不同,现有方法专门针对有或没有真实标签的学习,FairerCLIP可适应两种场景下的学习。2)易于优化:FairerCLIP适用于涉及闭式求解器的迭代优化,这使得训练速度比现有方法快4到10倍。3)样本效率:在样本有限的条件下,当基线方法完全失败时,FairerCLIP显著优于它们。4)性能:实证表明,在基准公平性和伪相关数据集上,FairerCLIP相对于各自的基线方法取得了可观的准确率提升。
引用
@article{arxiv.2403.15593,
title = {FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs},
author = {Sepehr Dehdashtian and Lan Wang and Vishnu Naresh Boddeti},
journal= {arXiv preprint arXiv:2403.15593},
year = {2024}
}
备注
The Twelfth International Conference on Learning Representations (ICLR) 2024