FairDeDup:检测和消除语义数据去重中的视觉语言公平性差异
计算机视觉与模式识别
2024-04-26 v1 人工智能
计算与语言
摘要
最近的dataset去重技术表明,内容感知的数据修剪可以在不显著�损失相对于原始数据集的性能的情况下,大幅降低训练视觉语言预训练(VLP)模型的成本。这些结果基于对常见的图像-标题数据集进行修剪,这些数据集从网络上收集,已知存在有害的社会偏见,这些偏见可能随后被编码到训练好的模型中。本文评估了去重如何影响结果训练模型中这些偏见的普遍性,并引入一种对SemDeDup算法的简单易用的修改,以减少我们观察到的负面影响。当 examining 在LAION-400M上进行去重的变体训练的 CLIP 模型时,我们发现我们提出的 FairDeDup 算法在 FairFace 和 FACET 数据集上 consistently 领先于 SemDeDup,同时在 CLIP benchmark 上保持零样本性能。
引用
@article{arxiv.2404.16123,
title = {FairDeDup: Detecting and Mitigating Vision-Language Fairness Disparities in Semantic Dataset Deduplication},
author = {Eric Slyman and Stefan Lee and Scott Cohen and Kushal Kafle},
journal= {arXiv preprint arXiv:2404.16123},
year = {2024}
}
备注
Conference paper at CVPR 2024. 6 pages, 8 figures. Project Page: https://ericslyman.com/fairdedup/