中文

论文探讨种族表示对高风险决策去偏 effectiveness 与泛化性

计算机与社会 2025-10-07 v2 人工智能 计算与语言 机器学习

摘要

理解与缓解偏见是大语言模型(LLM)在高风险决策中采用的关键。我们引入Admissions和Hiring决策任务,构建假设性申请人档案,其中可从姓名推断出个人种族,作为种族偏见的简化测试环境。我们展示Gemma 2B Instruct和LLaMA 3.2 3B Instruct exhibit强烈偏见。Gemma拒绝26%更多的非裔申请人,而LLaMA对亚裔申请人招聘比对非裔申请人高60%。我们证明这些偏见对提示工程具有抗性:多种提示策略均未能促进公平。相比之下,通过分布式对齐搜索,我们可在模型激活中识别“种族子空间”,并对其进行干预以消除偏见。对所有种族子空间中表示的平均值可使Gemma的偏见降低37-57%。最后,我们检验Gemma种族子空间的泛化性,发现仅在改变提示格式时,种族表示可能受影响。我们的工作表明,机制化方法可能为改善LLM公平性提供前景,但通用的种族表示仍显得难以实现。

关键词

引用

@article{arxiv.2504.06303,
  title  = {On the Effectiveness and Generalization of Race Representations for Debiasing High-Stakes Decisions},
  author = {Dang Nguyen and Chenhao Tan},
  journal= {arXiv preprint arXiv:2504.06303},
  year   = {2025}
}

备注

21 pages, 15 figures, 14 tables. Accepted as a conference paper at COLM 2025. Camera-ready