数据漫画:预训练语料库中非裔美国语言的表征
计算与语言
2025-07-29 v2
摘要
通过定量实验、人工判断和定性分析的结合,我们评估了 12 个以英语为主的开放源代码预训练语料库中非裔美国语言(AAL)的数量和质量表征。我们特别关注代表 AAL 说话社区的 AAL 文本的来源、变异性和自然性。我们发现,与美国人口统计相比,AAL 在所有被评估的预训练语料库中代表性不足,仅占文档的 0.007% 至最多 0.18%。我们还发现,C4 中超过 25% 的 AAL 文本可能被认为不适合大语言模型(LLM)生成和强化有害刻板印象。最后,我们发现大多数自动过滤器在预训练语料库中更倾向于保留白人标准英语(WME)文本而非 AAL 文本。
引用
@article{arxiv.2503.10789,
title = {Data Caricatures: On the Representation of African American Language in Pretraining Corpora},
author = {Nicholas Deas and Blake Vente and Amith Ananthram and Jessica A. Grieser and Desmond Patton and Shana Kleiner and James Shepard and Kathleen McKeown},
journal= {arXiv preprint arXiv:2503.10789},
year = {2025}
}
备注
ACL 2025