对齐减少了表露的性别偏见,但不影响编码的性别偏见:统一框架与研究
计算与语言
2026-05-14 v2
摘要
在训练期间,大型语言模型(LLM)会学习社会常规,这些常规可能导致下游应用中的性别偏见。大多数缓解措施侧重于减少生成输出中的偏见,通常在结构化基准测试上进行评估,这引发了两个担忧:输出水平的评估无法揭示对齐是否修改了模型的底层表示,而结构化基准测试可能不反映真实使用场景。我们提出了一个统一框架,用于使用相同中性提示词joint分析LLM中内在偏见和外在偏见,从而实现对性别相关信息在内部表示与生成输出中表达偏见的直接比较。与先前报告弱或不一致相关性的工作不同,我们发现,在统一协议下测量时,潜在的性别信息与表达的偏见之间存在一致的关联。我们进一步检查了通过旨在减少性别偏见的监督微调对齐的效果。我们的结果表明,后者确实减少了表露的偏见,但内部表示中仍然存在可测量的性别相关关联,并且在对抗性提示下可以被重新激活。最后,我们考虑了两种真实场景,表明在结构化基准测试上观察到的去偏效果并不一定概括,例如在故事生成的情况下。
引用
@article{arxiv.2603.24125,
title = {Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study},
author = {Nour Bouchouchi and Thibault Laugel and Xavier Renard and Christophe Marsala and Marie-Jeanne Lesot and Marcin Detyniecki},
journal= {arXiv preprint arXiv:2603.24125},
year = {2026}
}