多模态模型中的种族分类的暗面:数据规模评估
摘要
规模模型、规模数据、规模GPU集群是当今生成式AI世界的主导思潮。尽管模型规模已得到广泛研究,但数据规模及其对模型性能的后续影响仍未得到充分探索。这在多模态数据集背景下尤为重要,这些数据集主要来源于世界大网,被压缩包装为Common Crawl dump,已知存在诸多缺陷。本文评估了数据规模对14个视觉-语言模型(VLMs)的后续影响,这些模型在LAION400-M和LAION-2B数据集上进行训练,通过测量种族和性别偏见使用芝加哥面部数据集(CFD)作为探针。我们的结果表明,随着训练数据的增加,预训练CLIP模型将人类图像误分类为如黑�猩、�gorilla和橘猴等非人类有害类的概率降低,但将相同图像误分类为人类有害类(如刑犯)的概率反而增加。 Furthermore, of the 14个基于Vision Transformer的VLMs我们评估的模型, 当数据集从40000万样本扩展到20亿样本时,基于ViT-L模型的预测概率,对于黑人男性和拉美裔男性被误预测为刑犯的概率分别增加65%和69%。相反,对于较小的基础ViT-B模型, 当数据集从40000万样本扩展到20亿样本时, 预测黑人男性和拉美裔男性为刑犯的概率分别下降20%和47%。我们对模型审计结果进行了定性和历史分析,反思我们的发现及其对数据策ils实践的含义,并总结了缓解措施及未来方向。内容警告:本文包含种族去人化和冒犯性描述。
引用
@article{arxiv.2405.04623,
title = {The Dark Side of Dataset Scaling: Evaluating Racial Classification in Multimodal Models},
author = {Abeba Birhane and Sepehr Dehdashtian and Vinay Uday Prabhu and Vishnu Boddeti},
journal= {arXiv preprint arXiv:2405.04623},
year = {2024}
}
备注
To appear in the proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT 24), June 3 to 6, 2024, Rio de Janeiro, Brazil. arXiv admin note: text overlap with arXiv:2306.13141