中文

更多同样的东西:在增加表征下保持持久的代表性伤害

计算与语言 2025-11-03 v3 人工智能

摘要

为识别和缓解生成式 AI 系统的伤害,关键在于考虑不同社会群体是否被这些系统所代表以及如何被代表。当 naively 测量或改善谁被代表时,一个关键缺口即显现,因为这不考虑人们如何被代表。本文发展了 GAS(P),一种用于暴露生成文本中分布层面群体代表性偏差的评估方法,针对群体未被提前指定(即群体未在生成系统的输入中指定)的情境。我们将该新方法应用于调查大型语言模型中职业领域的性别代表性。我们表明,尽管模型在生成传记时导致女性代表性大幅提升,但即便如此,不同性别的代表性偏差仍然存在。我们的评估方法揭示了在不同职业中对不同性别传记和人物描述所选词汇存在统计显著的分布层面差异,我们进一步表明许多差异与代表性伤害和刻板印�有关。我们的实证发现警示,即使在 naively 增加(未被提前指定)的代表性,仍可能无意中扩大代表性偏差,我们提出的评估方法 enables 对该问题进行系统且严谨的测量。

关键词

引用

@article{arxiv.2503.00333,
  title  = {More of the Same: Persistent Representational Harms Under Increased Representation},
  author = {Jennifer Mickel and Maria De-Arteaga and Leqi Liu and Kevin Tian},
  journal= {arXiv preprint arXiv:2503.00333},
  year   = {2025}
}

备注

Proceedings of the Neural Information Processing Systems (NeurIPS) 2025; 39 pages, 7 figures, 15 tables