中文

从全局到局部:CLIP中的社会偏见传递

计算机视觉与模式识别 2025-08-26 v1

摘要

大量下游任务的对比语言-图像预训练(CLIP)模型作为 backbone 的再循环,调用 necessitates 对其传递性影响进行彻底分析,尤其是其已记录的再现社会偏见和人类刻板印象。这些偏见在预训练期间学习的偏见如何传递到视觉问答或图像描述等下游应用?它们是否以任何方式传递?我们通过全面实证分析研究了这一现象,称为偏见传递。首先,我们检查了在全局和局部数据视图之间,预训练偏见的差异,发现偏见测量高度取决于其计算的子数据集。其次,我们分析了预训练模型中的偏见与下游任务之间的相关性,随着预训练偏见水平的变化,发现难以发现一致的偏见传递趋势。最后,我们探讨了这种不一致性的原因,表明在当前范式下,不同预训练CLIP的表示空间倾向于在为下游任务进行适配时趋于收敛。我们希望本工作提供有价值的见解,以 inform future research 以促进更好的偏见缓解实践。

关键词

引用

@article{arxiv.2508.17750,
  title  = {From Global to Local: Social Bias Transfer in CLIP},
  author = {Ryan Ramos and Yusuke Hirota and Yuta Nakashima and Noa Garcia},
  journal= {arXiv preprint arXiv:2508.17750},
  year   = {2025}
}