中文

被静默的偏见:LLM 学会拒绝的阴暗面

计算与语言 2026-03-19 v4 机器学习

摘要

安全对齐的大语言模型(LLM)正日益普及,尤其是在公平性至关重要且偏见输出可能造成重大危害的敏感应用中。然而,评估模型的公平性是一项复杂的挑战,现有的评估方法通常采用标准的问答(QA)方案。这类方法往往通过将模型的拒绝响应解读为正向的公平性度量来忽视更深层次的问题,从而造成虚假的公平感。在本工作中,我们引入了“被静默的偏见”的概念,即编码在模型潜在空间中的不公平偏好,它们被安全对齐有效掩盖。以往考虑类似间接偏见的方法通常依赖于提示操纵或手工构造的隐式查询,其可扩展性有限,且存在引入额外偏见污染评估过程的风险。我们提出了被静默偏见基准(SBB),旨在通过采用激活引导来减少 QA 过程中的模型拒绝,从而揭示这些偏见。SBB 支持便捷地扩展至新的人口群体和主题,提供了一个公平性评估框架,鼓励未来开发超越对齐训练掩盖效应的公平模型与工具。我们在多个 LLM 上展示了该方法,研究结果揭示了模型的直接响应与其潜在公平性问题之间令人担忧的差异。

关键词

引用

@article{arxiv.2511.03369,
  title  = {Silenced Biases: The Dark Side LLMs Learned to Refuse},
  author = {Rom Himelstein and Amit LeVi and Brit Youngmann and Yaniv Nemcovsky and Avi Mendelson},
  journal= {arXiv preprint arXiv:2511.03369},
  year   = {2026}
}

备注

Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)