中文

消除 CLIP 中的偏见:多模态学习中平衡数据的有效性如何?

机器学习 2024-03-08 v1 人工智能

摘要

我们研究了数据平衡在缓解对比语言-图像预训练(CLIP)中偏见的有效性,并指出了其优势与局限性。首先,我们重申了先前的结论,即 CLIP 模型可能会无意中吸收社会偏见。为了应对这一点,我们提出了一种名为多模态矩匹配(M4)的新算法,旨在减少多模态数据中的表征偏见和关联偏见(即一阶和二阶统计量)。我们使用 M4 进行了深入分析,考虑了模型、表征和数据大小等各种因素。我们的研究还探讨了 CLIP 学习和遗忘偏见的动态特性。特别是,我们发现微调在对抗表征偏见方面是有效的,尽管其影响在关联偏见方面有所减弱。此外,数据平衡对质量的影响是混合的:它倾向于改善分类,但可能损害检索。有趣的是,数据和架构的改进似乎减轻了数据平衡对性能的负面影响;例如,将 M4 应用于带有数据质量过滤器的 SigLIP-B/16,将 COCO 图像到文本的检索 @5 从 86%(无数据平衡)提高到 87%,将 ImageNet 零样本分类从 77% 提高到 77.5%!最后,我们总结了提高多模态系统中数据平衡有效性的建议。

关键词

引用

@article{arxiv.2403.04547,
  title  = {CLIP the Bias: How Useful is Balancing Data in Multimodal Learning?},
  author = {Ibrahim Alabdulmohsin and Xiao Wang and Andreas Steiner and Priya Goyal and Alexander D'Amour and Xiaohua Zhai},
  journal= {arXiv preprint arXiv:2403.04547},
  year   = {2024}
}

备注

32 pages, 20 figures, 7 tables