Side-by-side 比较加剧了语言模型中的方言偏见
计算与语言
2026-05-26 v1 人工智能
摘要
语言模型(LM)即使在没有方言标签的情况下,也会对基于其方言差异的说话者表现出系统性偏见,这种行为称为隐蔽方言偏见。本文通过评估 LM 如何将社会心理学研究中推导的刻板特征与标准美式英语(SAE)和非裔美式英语(AAVE)中的等意义推文进行关联来量化隐蔽方言偏见。尽管 prior 工作表明 LM 在单独评估推文时会将更多负面刻板特征与 AAVE 联系起来,但我们惊讶地发现,当 SAE/AAVE 推文成对并排比较时,这种偏见显著加剧,这种情境更贴近模型用于排序候选人的高影响力决策情境。只有在明确指定方言标签时,偏见才会进一步恶化。这一发现颇具震撼,尽管商业开发商已致力于缓解 LM 中的偏见。令人鼓舞的是,我们表明反事实公平微调可以缓解隐蔽方言偏见,尽管对某些刻板特征在单独评估推文时可减少平均差异,但这些改进在并排评估 SAE/AAVE 推文时并不一致地保持。我们的发现表明,现有的隐蔽方言偏见评估设置可能低估其严重程度,特别是在对比情境下。此外,尽管经过安全对齐微调,明显的方言偏见仍然显著,表明这仍是一个未解决的问题,并催生需要更稳健评估和缓解框架的需求。
引用
@article{arxiv.2605.24384,
title = {Side-by-side Comparison Amplifies Dialect Bias in Language Models},
author = {Kritee Kondapally and Claire J. Smerdon and Pooja C. Patel and Ogheneyoma Akoni and Jevon Torres and Jaspreet Ranjit and Matthew Finlayson and Swabha Swayamdipta},
journal= {arXiv preprint arXiv:2605.24384},
year = {2026}
}
备注
In proceeding at ACM Conference on Fairness, Accountability, and Transparency 2026