中文

关于 "FairCLIP:在视觉语言学习中釆取公平性" 的可重复性研究

计算机视觉与模式识别 2025-09-09 v1 人工智能 机器学习

摘要

我们调查了FairCLIP(由Luo等人于2024年提出)的可重复性,该方法通过最小化跨敏感群体的图像-文本相似度得分差异(使用Sinkhorn距离),提高了CLIP(Radford等人,2021)在组公平性方面的表现。我们复现了Luo等人(2024年)的实验设置,以主要调查其研究发现为目的。然而,Luo等人(2024年)的模型描述与原始实现存在差异。因此,我们引入了新的实现A-FairCLIP,以检验特定设计选择。此外,我们提出了FairCLIP+,将FairCLIP目标扩展到多个属性。此外,探讨了距离最小化对FairCLIP公平性和性能的影响。在与原始作者一致的情况下,发现CLIP在应用于基于Harvard-FairVLMed数据集中的零样本白内障分类时,对某些人口统计学特征倾向性较强。然而,两个数据集上的实验结果并不支持其声称FairCLIP能够提高CLIP的性能和公平性的说法。尽管正则化目标降低了Sinkhorn距离,但无论是官方实现还是对齐后的A-FairCLIP实现,都未发现能够在零样本白内障分类中提升性能或公平性。

关键词

引用

@article{arxiv.2509.06535,
  title  = {On the Reproducibility of "FairCLIP: Harnessing Fairness in Vision-Language Learning''},
  author = {Hua Chang Bakker and Stan Fris and Angela Madelon Bernardy and Stan Deutekom},
  journal= {arXiv preprint arXiv:2509.06535},
  year   = {2025}
}