QueerGen:大型语言模型在句子补全任务中如何反映关于性别与性取向的社会规范
计算与语言
2026-01-29 v1 人工智能
计算机与社会
摘要
本文考察了大型语言模型(LLMs)如何再现社会规范,特别是异性恋中心规范,以及这些规范如何转化为其文本生成中可测量的偏见。我们研究了关于主体性别或性取向的显式信息是否会影响LLM在三个主体类别中的响应:酷儿标记、非酷儿标记和规范化的“无标记”类别。表征失衡被操作化为英语句子补全在四个维度上的可测量差异:情感、尊重、毒性以及预测多样性。我们的研究结果表明,掩码语言模型(MLMs)对酷儿标记主体产生最不利的情感、更高的毒性和更负面的尊重。自回归语言模型(ARLMs)部分缓解了这些模式,而封闭访问的ARLMs往往对无标记主体产生更有害的输出。结果表明,LLMs再现了规范性的社会假设,尽管偏见的形式和程度强烈依赖于特定的模型特征,这可能重新分配但并未消除表征危害。
引用
@article{arxiv.2601.20731,
title = {QueerGen: How LLMs Reflect Societal Norms on Gender and Sexuality in Sentence Completion Tasks},
author = {Mae Sosto and Delfina Sol Martinez Pandiani and Laura Hollink},
journal= {arXiv preprint arXiv:2601.20731},
year = {2026}
}