关于数据沼泽中仇恨内容的缩放定律
计算机与社会
2023-06-30 v2
摘要
“缩放模型、缩放数据、缩放 GPU 集群”是当今生成式 AI 世界的主导情绪。尽管模型缩放已被广泛研究,数据缩放及其下游影响仍待充分探索。这在视觉-语言数据集的背景下尤为关键,此类数据集主要来源为万维网,经浓缩并打包为 CommonCrawl 转储。这一已知存在诸多缺陷的大规模数据转储被反复挖掘,并作为大型生成模型的数据母矿。在本文中,我们:1)通过对分别包含 4 亿和 20 亿样本的 LAION-400M 与 LAION-2B-en 的比较审计,考察数据集缩放对仇恨内容的影响;2)使用芝加哥面孔数据集(CFD)作为探针,测量在这些数据集变体上训练的视觉-语言模型的种族偏见,评估缩放对模型的下游影响。我们的结果表明:1)使用 Pysentimiento 仇恨检测自然语言处理(NLP)模型推断的仇恨内容率(HCR)指标衡量,数据集中仇恨内容的存在增加了近 ;2)我们所评估模型的社会偏见与负面刻板印象也随缩放而加剧。随着规模增大,模型将人脸图像与“人类”类(而非其他 7 个攻击性类)关联的趋势减半。此外,对于黑人女性类别,模型将其面孔与“罪犯”类关联的趋势翻倍,而对于黑人男性面孔则增至五倍。我们对模型审计结果给出定性与历史分析,反思发现及其对数据集策展实践的启示,并以 findings 总结与未来潜在工作作结。
引用
@article{arxiv.2306.13141,
title = {On Hate Scaling Laws For Data-Swamps},
author = {Abeba Birhane and Vinay Prabhu and Sang Han and Vishnu Naresh Boddeti},
journal= {arXiv preprint arXiv:2306.13141},
year = {2023}
}