中文

关于数据沼泽中仇恨内容的缩放定律

计算机与社会 2023-06-30 v2

摘要

“缩放模型、缩放数据、缩放 GPU 集群”是当今生成式 AI 世界的主导情绪。尽管模型缩放已被广泛研究,数据缩放及其下游影响仍待充分探索。这在视觉-语言数据集的背景下尤为关键,此类数据集主要来源为万维网,经浓缩并打包为 CommonCrawl 转储。这一已知存在诸多缺陷的大规模数据转储被反复挖掘,并作为大型生成模型的数据母矿。在本文中,我们:1)通过对分别包含 4 亿和 20 亿样本的 LAION-400M 与 LAION-2B-en 的比较审计,考察数据集缩放对仇恨内容的影响;2)使用芝加哥面孔数据集(CFD)作为探针,测量在这些数据集变体上训练的视觉-语言模型的种族偏见,评估缩放对模型的下游影响。我们的结果表明:1)使用 Pysentimiento 仇恨检测自然语言处理(NLP)模型推断的仇恨内容率(HCR)指标衡量,数据集中仇恨内容的存在增加了近 12%12\%;2)我们所评估模型的社会偏见与负面刻板印象也随缩放而加剧。随着规模增大,模型将人脸图像与“人类”类(而非其他 7 个攻击性类)关联的趋势减半。此外,对于黑人女性类别,模型将其面孔与“罪犯”类关联的趋势翻倍,而对于黑人男性面孔则增至五倍。我们对模型审计结果给出定性与历史分析,反思发现及其对数据集策展实践的启示,并以 findings 总结与未来潜在工作作结。

关键词

引用

@article{arxiv.2306.13141,
  title  = {On Hate Scaling Laws For Data-Swamps},
  author = {Abeba Birhane and Vinay Prabhu and Sang Han and Vishnu Naresh Boddeti},
  journal= {arXiv preprint arXiv:2306.13141},
  year   = {2023}
}