中文

被拒绝的方言:奖励模型中对非裔美国语言的偏见

计算与语言 2025-02-19 v1 人工智能 计算机与社会

摘要

通过奖励模型进行偏好对齐有助于构建安全、有用且可靠的大语言模型(LLMs)。然而,偏好判断中的主观性以及偏好数据收集过程中代表性抽样的缺乏可能引入新的偏见,阻碍奖励模型的公平性与公正性。在这项工作中,我们提出了一种评估奖励模型中方言偏见的框架,并通过若干实验对非裔美国语言(AAL)的偏见进行了案例研究,比较奖励模型在配对的白人主流英语(WME)和机器翻译及人工撰写的 AAL 语料库上的偏好和行为。我们表明,奖励模型在处理 AAL 文本时与人类偏好的一致性低于 WME 文本(平均准确率下降 4%),经常不偏好 AAL 对齐的文本而非 WME 对齐的文本,并且即使在收到 AAL 文本提示时也会将对话引向 WME。我们的发现提供了对 LLM 开发过程中一个相对未被充分研究的阶段中反 AAL 偏见的针对性分析,强调了与 AAL 相关的代表性伤害和关于 LLM 期望行为的伦理问题。

关键词

引用

@article{arxiv.2502.12858,
  title  = {Rejected Dialects: Biases Against African American Language in Reward Models},
  author = {Joel Mire and Zubin Trivadi Aysola and Daniel Chechelnitsky and Nicholas Deas and Chrysoula Zerva and Maarten Sap},
  journal= {arXiv preprint arXiv:2502.12858},
  year   = {2025}
}

备注

Accepted to NAACL Findings 2025