对齐但盲目:对齐通过降低种族意识增加隐性偏见
计算与语言
2025-06-10 v3 人工智能
计算机与社会
摘要
尽管价值对齐的语言模型在显式偏见评估中显得无偏见,但它们在隐性词汇联想任务中常表现出刻板印象,引发了对其公平使用的担忧。我们调查了这种差异背后的机制,并发现对齐惊人地放大了模型输出中的隐性偏见。具体而言,我们表明,与未对齐的模型不同,对齐的 LM 在上下文模糊时会忽略早期内部表示中的种族概念。不表示种族可能无法激活安全防护机制,从而导致无意的偏见。受此启发,我们提出了一种新的偏见缓解策略,通过激励在模型早期层中表示种族概念来发挥作用。与机器遗忘的传统缓解方法相反,我们的干预发现,引导模型更加意识到种族概念能有效缓解隐性偏见。类似于人类的种族盲视,忽略种族细微差别会在 LM 中无意地延续微妙的偏见。
引用
@article{arxiv.2506.00253,
title = {Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race},
author = {Lihao Sun and Chengzhi Mao and Valentin Hofmann and Xuechunzi Bai},
journal= {arXiv preprint arXiv:2506.00253},
year = {2025}
}
备注
Accepted to ACL 2025 (Main)