中文

内在偏见由预训练数据预测且与下游性能相关:视觉语言编码器中的分析

人工智能 2025-06-11 v2

摘要

虽然近期研究发现,遵循对比语言图像预训练(CLIP)框架训练的视觉语言模型包含固有的社会偏见,但不同预训练框架特征的影响范围,以及这些偏见如何与下游性能相关,仍不为人所知。本文present了目前为止规模最大、最全面的分析,探讨了CLIP模型的上游预训练因素与下游性能如何与其内在偏见相关。我们研究了131个独立的CLIP模型,这些模型在26个数据集上训练,使用55种不同的架构,并在各种规模下进行训练。我们使用26个已建立的单模态和跨模态原则性嵌入关联测试,对每个模型评估偏见。我们发现,预训练数据集的选择是预测偏见最重要的上游因素,而架构变异的影响最小。此外,旨在增强下游模型性能的精细化筛选数据集倾向于associated更高水平的内在偏见。最后,我们观察到,内在偏见通常与下游性能显著相关(0.3r0.80.3 \leq r \leq 0.8),这表明针对性能优化的模型不经意地学习放大表征偏见。比较单模态和跨模态关联测试的结果表明,社会群体偏见对模态性影响很大。我们的发现表明,需要更为精细的策略来解决视觉语言模型在整个模型开发管道中的内在偏见问题。

关键词

引用

@article{arxiv.2502.07957,
  title  = {Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language Encoders},
  author = {Kshitish Ghate and Isaac Slaughter and Kyra Wilson and Mona Diab and Aylin Caliskan},
  journal= {arXiv preprint arXiv:2502.07957},
  year   = {2025}
}

备注

Accepted to NAACL Main, 2025