面向开放环境的大型语言模型社会偏见评估与缓解
计算与语言
2025-10-16 v4
摘要
当前的社会偏见基准主要依赖于预定义的问答格式,如多选题,限制了其反映真实世界交互的复杂性和开放性。为弥合这一差距,我们扩展了现有数据集BBQ(Parrish等,2022),构建Open-BBQ,一个综合性框架,用于在开放环境中评估大型语言模型(LLM)的社会偏见,通过纳入两个额外的问答类别:填空题和简答题。由于新的Open-BBQ数据集包含大量开放式响应(如句子和段落),我们开发了一种评估过程,通过标记句子和段落来检测其中的偏见。此外,我们发现诸如自我去偏见(Gallegos等,2024)等现有去偏方法存在过度纠正问题,这会使原始正确答案变得错误。为解决这一问题,我们提出了Composite Prompting,这是一种集成结构化示例与显式链式思维推理的上下文学习(ICL)方法,用于构建统一的指令模板,使LLM能够显式识别需要去偏的内容。实验结果表明,我们提出的方法在保持高准确率的同时显著降低了GPT-3.5和GPT-4o的偏见。
引用
@article{arxiv.2412.06134,
title = {Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings},
author = {Zhao Liu and Tian Xie and Xueru Zhang},
journal= {arXiv preprint arXiv:2412.06134},
year = {2025}
}
备注
15 pages