中文

语言模型中的性别问题:基于性别表现理论的实证审计

计算与语言 2025-05-21 v1 人工智能 计算机与社会 人机交互

摘要

语言模型编码并随后延续有害性性别刻板印�。研究已成功缓解了其中一些伤害,例如通过将非性别化术语如职业与性别化术语如 "woman" 和 "man" 分离。这一方法然而仍显得浅层,因为仅关联是性别伤害产生的一种形式。性别批判性学术研究,如性别表现理论,强调伤害往往源于性别本身的建构方式,例如将性别等同于生物性别。在语言模型中,这些问题可能导致对跨性别和性别多样身份的抹杀,并在下游应用中引发伤害,从误称用户到基于对解剖学错误假设对患者误诊。为了超越语言关联的浅层处理,FAccT 关于性别伤害的研究需要更广泛地定义 "性别偏见"。我们从性别研究文献中对性别建构的洞见出发,对16种不同架构、训练数据集和模型大小的语言模型进行实证测试。我们发现,语言模型倾向于将性别编码为与生物性别相关的二元类别,且那些不清晰地落入这一二元类别的性别术语会被抹杀和病化。最后,我们表明,较大的模型(在性能基准测试中取得好结果)学习了更强的性别与性别之间的关联,从而进一步强化了对性别的狭窄理解。我们的发现导致我们呼吁重新评估如何定义和解决语言模型中的性别伤害。

关键词

引用

@article{arxiv.2505.14080,
  title  = {Gender Trouble in Language Models: An Empirical Audit Guided by Gender Performativity Theory},
  author = {Franziska Sofia Hafner and Ana Valdivia and Luc Rocher},
  journal= {arXiv preprint arXiv:2505.14080},
  year   = {2025}
}