论文探讨种族表示对高风险决策去偏 effectiveness 与泛化性
计算机与社会
2025-10-07 v2 人工智能
计算与语言
机器学习
摘要
理解与缓解偏见是大语言模型(LLM)在高风险决策中采用的关键。我们引入Admissions和Hiring决策任务,构建假设性申请人档案,其中可从姓名推断出个人种族,作为种族偏见的简化测试环境。我们展示Gemma 2B Instruct和LLaMA 3.2 3B Instruct exhibit强烈偏见。Gemma拒绝26%更多的非裔申请人,而LLaMA对亚裔申请人招聘比对非裔申请人高60%。我们证明这些偏见对提示工程具有抗性:多种提示策略均未能促进公平。相比之下,通过分布式对齐搜索,我们可在模型激活中识别“种族子空间”,并对其进行干预以消除偏见。对所有种族子空间中表示的平均值可使Gemma的偏见降低37-57%。最后,我们检验Gemma种族子空间的泛化性,发现仅在改变提示格式时,种族表示可能受影响。我们的工作表明,机制化方法可能为改善LLM公平性提供前景,但通用的种族表示仍显得难以实现。
引用
@article{arxiv.2504.06303,
title = {On the Effectiveness and Generalization of Race Representations for Debiasing High-Stakes Decisions},
author = {Dang Nguyen and Chenhao Tan},
journal= {arXiv preprint arXiv:2504.06303},
year = {2025}
}
备注
21 pages, 15 figures, 14 tables. Accepted as a conference paper at COLM 2025. Camera-ready