公平调解器:中和大语言模型中的刻板印象关联以缓解偏见
软件工程
2025-04-11 v1
摘要
大语言模型在多样应用中展现出卓越性能,但不可避免地吸收了训练数据中的虚假关联,导致刻板印象关联偏向特定社会群体。这些关联不仅延续并放大了有害社会偏见,更引发了显著的公平性问题。为缓解此类偏见, prior 研究尝试在推理过程中将模型嵌入无偏空间,但效果有限,因其与下游社会偏见的对齐不足。灵感来自观察到语言模型中的概念认知主要通过线性关联记忆机制表示,其中关键-值映射发生在 MLP 层,我们认为偏见概念与社会群体类似地编码为实体(key)和信息(value)对,可被操控以促进更公平的关联。为此,我们提出了公平调解器(FairMed),一个中和刻板印象关联的偏见缓解框架。该框架包含两个主要组件:刻板印象关联探测器和对抗去偏中和器。探测器通过聚焦偏见概念的提示词,捕获 MLP 层激活中刻板印象关联的发射概率。随后,对抗去偏中和器在推理过程中干预 MLP 激活,以在不同社会群体间均衡关联概率。跨九个受保护属性的广泛实验表明,FairMed 在有效性上显著优于 SOTA 方法。相较于最有效的基线方法,FairMed 在效率上具有竞争力,通过缩短数百分钟的缓解开销。FairMed 还能在不损害整体性能的前提下保持语言模型的语言理解能力。
引用
@article{arxiv.2504.07787,
title = {Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models},
author = {Yisong Xiao and Aishan Liu and Siyuan Liang and Xianglong Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:2504.07787},
year = {2025}
}
备注
Accepted by ISSTA 2025.20 pages