评估检索增强对社会偏见的影响
计算与语言
2026-01-26 v3
摘要
检索增强生成(RAG)作为一种方便地将预训练阶段未见过的新事实融入基于大语言模型(LLM)的自然语言生成(NLG)系统的方法而广受欢迎。然而,LLM 已知编码了显著的不公平社会偏见。RAG 在 NLG 系统中对这些偏见的调节作用尚不明确。在本文中,我们系统地研究了 RAG 系统不同组件与在三种语言(即英语、日语和中文)和四种社会偏见类型(即性别、种族、年龄和宗教)中呈现的文本生成偏见之间的关系。具体而言,利用偏见问答(BBQ)基准数据集,我们评估了来自具有不同程度刻板印象偏见的文档集合的 RAG 响应中的社会偏见,使用了多种 LLM 作为生成器。我们发现,文档集合中的偏见往往在生成的响应中被放大,即使生成 LLM 表现出较低的偏见水平。我们的研究结果对将 RAG 作为向 NLG 系统注入新事实的技术使用提出了担忧,并呼吁在 RAG 应用的实际部署之前仔细评估潜在的社会偏见。
引用
@article{arxiv.2502.17611,
title = {Evaluating the Effect of Retrieval Augmentation on Social Biases},
author = {Tianhui Zhang and Yi Zhou and Danushka Bollegala},
journal= {arXiv preprint arXiv:2502.17611},
year = {2026}
}
备注
EACL26 main