中文

Open-DeBias:面向语言模型中开集偏差的缓解

计算与语言 2025-09-30 v1

摘要

大语言模型(LLM)在问答(QA)任务上取得了显著成功,但它们通常编码有害偏差,从而损害公平性和可信度。大多数现有的偏差缓解方法仅限于预定义类别,限制了它们应对新颖或上下文特定的涌现偏差的能力。为了弥合这一差距,我们研究了基于文本 QA 中的开集偏差检测与缓解这一新问题。我们引入了 OpenBiasBench,一个全面的基准,旨在评估广泛类别和子群中的偏差,涵盖已知和先前未见的偏差。此外,我们提出了 Open-DeBias,一种新颖的、数据高效且参数高效的偏差缓解方法,利用适配器模块来缓解现有的社会和刻板偏差,同时泛化到未见过的偏差。与最先进的 BMBI 方法相比,Open-DeBias 在 BBQ 数据集的模糊子集上将 QA 准确率提高了近 48%,在消歧子集上提高了 6%,使用的适配器仅基于训练数据的一小部分进行微调。值得注意的是,相同的适配器在零样本迁移到韩语 BBQ 时达到了 84% 的准确率,展示了稳健的语言无关泛化能力。通过广泛评估,我们还验证了 Open-DeBias 在广泛 NLP 任务(包括 StereoSet 和 CrowS-Pairs)中的有效性,突出了其鲁棒性、多语言能力和适用于通用、开域偏差缓解的适用性。项目页面地址为:https://sites.google.com/view/open-debias25

关键词

引用

@article{arxiv.2509.23805,
  title  = {Open-DeBias: Toward Mitigating Open-Set Bias in Language Models},
  author = {Arti Rani and Shweta Singh and Nihar Ranjan Sahoo and Gaurav Kumar Nayak},
  journal= {arXiv preprint arXiv:2509.23805},
  year   = {2025}
}

备注

25 pages, 3 figures, supplementary material included. To be published in EMNLP-2025