中文

通过偏好遗忘缓解语言模型中的偏见

计算与语言 2025-10-01 v1

摘要

众多研究表明,语言模型中存在针对不同人口统计群体的各种偏见,这些偏见放大了歧视并损害了公平性。最近的基于参数修改的去偏方法显著降低了文本连贯性和任务准确性等核心能力。而基于提示的去偏方法仅对预定义触发词有效,无法解决模型参数中深植的刻板印象关联。本文提出BiasUnlearn——一种新的模型去偏框架,通过协调刻板忘却与反刻板保持的双通道遗忘机制实现精准去偏,同时通过对抗遗忘集合和动态数据集交换防止偏见极性反转。我们针对多个语言模型在多个评估基准上进行了大量实验。结果表明,BiasUnlearn在缓解语言模型中的偏见方面优于现有方法,同时保持了语言建模能力。进一步实验表明,去偏权重可在不同模型变体之间传递,确认偏见表示在预训练阶段被植入并在微调阶段持续存在。

关键词

引用

@article{arxiv.2509.25673,
  title  = {Mitigating Biases in Language Models via Bias Unlearning},
  author = {Dianqing Liu and Yi Liu and Guoqing Jin and Zhendong Mao},
  journal= {arXiv preprint arXiv:2509.25673},
  year   = {2025}
}

备注

EMNLP 2025 MainConference