LLM 在道德判断中的广泛性别与代词偏见
适应与自组织系统
2026-03-17 v1
摘要
大型语言模型(LLMs)越来越多地用于评估道德或伦理陈述,但其判断可能反映社会和语言偏见。本工作提出了对 grammatical person、number 和 gender 标记如何影响 LLM 对公平性道德分类的影响进行受控、句子水平的研究。我们基于ETHICS数据集中的550个平衡基础句子,生成每个项目的26个反事实变体,通过系统性变更代词和人口统计标记,得到14,850个在语义上等价的句子。我们评估了六个模型家族(Grok、GPT、LLaMA、Gemma、DeepSeek 和 Mistral),并使用统计公平性差异(SPD)衡量公平性判断和群体间差异。结果显示统计显著偏见:以单数形式和第三人称书写的句子更常被判为“公平”,而第二人称的句子则受到惩罚。性别标记产生最强效果,非二元主体始终受到青睐,男性主体则受到不利。我们推测,这些模式反映了在训练期间所学习的分布性和对齐偏见,强调在道德 LLM 应用中需要针对公平性进行针对性干预的必要性。
引用
@article{arxiv.2603.13635,
title = {Emergent E-I Structure in Performance-Evolved Reservoir Networks of Neuronal Population Dynamics},
author = {Manish Yadav},
journal= {arXiv preprint arXiv:2603.13635},
year = {2026}
}
备注
9 pages, 5 figures