谁进谁出?DataComp 中多模态 CLIP 过滤的案例研究
计算机与社会
2024-10-11 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
随着训练数据集越来越多地来自非结构化、不受控制的环境(如网络),研究人员和行业从业者越来越依赖数据过滤技术来“滤除”网络抓取数据的“噪声”。虽然数据集已被广泛证明反映了其创建者的偏见和价值观,但本文为一项评估用于创建这些数据集的过滤器的新兴研究做出了贡献。我们表明,图像-文本数据过滤也存在偏见且充满价值判断,它编码了关于什么被视为“高质量”数据的特定概念。在我们的工作中,我们通过分析跨图像、文本和网站来源多种模态的各种注释技术的过滤差异,审计了学术基准 DataComp 的 CommonPool 上图像-文本 CLIP 过滤的标准方法。我们发现,与几个推定的人口群体(如 LGBTQ+ 人群、老年女性和年轻男性)相关的数据被排除的比例更高。此外,我们展示了排除放大的案例:某些边缘化群体不仅在未过滤的数据中代表性不足,而且 CLIP 过滤以更高的比例排除来自这些群体的数据。因此,机器学习流程中的数据过滤步骤可能会加剧数据收集步骤中已经存在的代表性差异,尤其是当现有过滤器旨在优化特定选择的下游性能指标(如零样本图像分类准确率)时。最后,我们表明 NSFW 过滤器未能从 CommonPool 中移除色情内容,并且 CLIP 过滤以高比例包含了若干类受版权保护的内容。我们的结论表明,数据集创建和过滤实践需要进行根本性变革。
引用
@article{arxiv.2405.08209,
title = {Who's in and who's out? A case study of multimodal CLIP-filtering in DataComp},
author = {Rachel Hong and William Agnew and Tadayoshi Kohno and Jamie Morgenstern},
journal= {arXiv preprint arXiv:2405.08209},
year = {2024}
}
备注
Content warning: This paper discusses societal stereotypes and sexually-explicit material that may be disturbing, distressing, and/or offensive to the reader