通过可解释性在真实场景中稳健提升 LLM 公平性
机器学习
2025-06-13 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)越来越多地部署在高风险招聘应用中,其决策直接影响人们的职业和生计。虽然先前研究表明简单的反偏见提示可以在受控评估中消除人口统计偏差,但我们发现当引入真实上下文细节时这些缓解措施会失效。我们通过内部偏差缓解来解决这些失效问题:通过识别并中和模型激活中的敏感属性方向,我们在所有测试场景中实现了稳健的偏差降低。在领先的商业模型(GPT-4o、Claude 4 Sonnet、Gemini 2.5 Flash)和开源模型(Gemma-2 27B、Gemma-3、Mistral-24B)上,我们发现添加真实上下文(如公司名称、公共职业页面的文化描述和选择性招聘约束,例如仅接受排名前 10% 的候选人)会引发显著的种族和性别偏差(面试率差异高达 12%)。当这些偏差出现时,在所有测试模型和场景中它们始终有利于黑人候选人而非白人候选人、女性候选人而非男性候选人。此外,模型可以从细微线索(如大学隶属关系)推断人口统计信息并产生偏差,即使检查模型的思维链推理时这些偏差也不可见。为解决这些限制,我们的内部偏差缓解识别种族和性别相关方向并在推理时应用仿射概念编辑。尽管使用的是来自简单合成数据集的方向,该干预仍能稳健泛化,始终将偏差降低到极低水平(通常低于 1%,始终低于 2.5%),同时在很大程度上保持模型性能。我们的发现表明,部署 LLM 进行招聘的从业者应采用更真实的评估方法,并考虑内部缓解策略以实现公平结果。
引用
@article{arxiv.2506.10922,
title = {Robustly Improving LLM Fairness in Realistic Settings via Interpretability},
author = {Adam Karvonen and Samuel Marks},
journal= {arXiv preprint arXiv:2506.10922},
year = {2025}
}