面向语言模型性别偏见缓解的上下文感知反事实数据增强
计算与语言
2026-02-11 v1 人工智能
摘要
在语言模型中缓解社会偏见的挑战之一是可能降低语言建模能力,这会损害下游性能。反事实数据增强(CDA)作为一种广泛使用的方法,凸显了这一问题:生成的合成数据可能与真实世界分布不符,或创建过于简单化的反事实情形,忽略了被改变的敏感属性(如性别)在预训练语料库中的社会语境。为此,我们提出一种简单而有效的上下文增强CDA方法,称为Context-CDA,利用大型语言模型提升解偏语料库的多样性和上下文相关性。通过最小化解偏语料库与预训练数据之间的差异,以增强上下文实现更好的对齐,从而提升语言建模能力。随后,我们采用基于不确定性的过滤机制排除由目标较小的语言模型(即需解偏的模型)认为质量较低的生成反事实文本,进一步提高微调语料库的质量。在性别偏见基准测试中进行的实验结果表明,Context-CDA能够在不牺牲语言建模性能的前提下有效缓解偏见,并通过分析下一个标记生成概率分布的变化,洞察了社会偏见。
引用
@article{arxiv.2602.09590,
title = {Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models},
author = {Shweta Parihar and Liu Guangliang and Natalie Parde and Lu Cheng},
journal= {arXiv preprint arXiv:2602.09590},
year = {2026}
}