LAION-400M 的以人为中心的标注:审计偏见及其对模型的迁移
计算机视觉与模式识别
2026-03-31 v2 计算与语言
计算机与社会
机器学习
摘要
训练于大规模多模态数据集上的视觉语言模型显示出强大的人口统计偏见,但训练数据在产生这些偏见方面的作用仍不清晰。一个主要障碍是 web 规模数据集(如 LAION-400M)缺乏人口统计标注。我们通过为整个数据集创建以人为中心的标注来弥合这一差距,包括超过 2.76 亿个边界框、感知性别和种族/民族标签,以及自动生成的描述。这些标注通过结合目标检测、多模态描述和微调分类器的验证自动标注管道生成。使用这些标注,我们发现了人口统计不平衡和有害关联,例如男性以及被感知为黑人或中东裔个体与与犯罪相关和负面内容的不成比例关联。我们还展示了线性拟合可从数据中的直接共现情况预测 CLIP 和 Stable Diffusion 中的 60-70% 的性别偏见。我们的资源建立了数据集构成与下游模型偏见之间的第一个大规模经验联系。代码可在 https://github.com/ExplainableML/LAION-400M-Person-Centric-Annotations 获取。
引用
@article{arxiv.2510.03721,
title = {Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models},
author = {Leander Girrbach and Stephan Alaniz and Genevieve Smith and Trevor Darrell and Zeynep Akata},
journal= {arXiv preprint arXiv:2510.03721},
year = {2026}
}
备注
ICLR 2026