中文

对齐但盲目:对齐通过降低种族意识增加隐性偏见

计算与语言 2025-06-10 v3 人工智能 计算机与社会

摘要

尽管价值对齐的语言模型在显式偏见评估中显得无偏见,但它们在隐性词汇联想任务中常表现出刻板印象,引发了对其公平使用的担忧。我们调查了这种差异背后的机制,并发现对齐惊人地放大了模型输出中的隐性偏见。具体而言,我们表明,与未对齐的模型不同,对齐的 LM 在上下文模糊时会忽略早期内部表示中的种族概念。不表示种族可能无法激活安全防护机制,从而导致无意的偏见。受此启发,我们提出了一种新的偏见缓解策略,通过激励在模型早期层中表示种族概念来发挥作用。与机器遗忘的传统缓解方法相反,我们的干预发现,引导模型更加意识到种族概念能有效缓解隐性偏见。类似于人类的种族盲视,忽略种族细微差别会在 LM 中无意地延续微妙的偏见。

关键词

引用

@article{arxiv.2506.00253,
  title  = {Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race},
  author = {Lihao Sun and Chengzhi Mao and Valentin Hofmann and Xuechunzi Bai},
  journal= {arXiv preprint arXiv:2506.00253},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main)