中文

大型语言模型用于文本标注时复刻种族刻板印象

计算与语言 2026-03-17 v1 人工智能

摘要

大型语言模型(LLMs)正在被广泛用于从学术研究到内容 moderation 和招聘等领域的自动化文本标注任务。我们在 19 个大型语言模型和两个总计超过 400 万个标注判断的实验中,展示了文本中嵌入的细微身份线索会系统性地偏向标注结果,这些偏向方式与种族刻板印象相吻合。在一个覆盖 39 个标注任务的姓名实验中,包含与黑人相关联的姓名的文本被评价为更具攻击性(18 个模型中),以及更 gossipy(18 个模型中)。亚裔姓名产生一种竹笼效应:17 个模型中将其评价为更聪明,而 18 个模型中将其评价为更不自信且更不社交。阿拉伯姓名引发认知提升和人际贬值,而所有四个少数族裔都被系统性地评价为不够自律。在一个匹配方言的实验中,相同句子在非洲裔美国英语(AAVE)而非标准美国英语时,被评价为更不专业(所有 19 个模型,平均差值为 -0.774)、更不具教育背景(-0.688)、更有毒性(18/19)以及更愤怒(19/19)。值得注意的例外情况出现在基于姓名的雇佣可行性评估中,通过 fine-tuning 似乎过度纠正,系统性地偏好少数族裔的求职者。在这些发现表明,使用大型语言模型作为自动标注工具会将社会模式化的偏见直接嵌入日益支撑着研究、治理和决策的各类数据集和测量中。

关键词

引用

@article{arxiv.2603.13891,
  title  = {Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation},
  author = {Petter Törnberg},
  journal= {arXiv preprint arXiv:2603.13891},
  year   = {2026}
}