中文

评估 RAG 系统中的社会偏见:外部上下文何时有帮助,推理为何有害

计算与语言 2026-02-11 v1 人工智能

摘要

大型语言模型(LLM)中固有的社会偏见引发了显著的公平性担忧。检索增强生成(RAG)架构通过检索外部知识源来增强 LLM 的生成能力,仍然面临相同的偏见相关挑战。本工作聚焦于评估和理解 RAG 的社会偏见影响。通过在各种检索语料库、LLM 和偏见评估数据集上进行大规模实验,覆盖超过 13 种偏见类型,我们惊讶地发现 RAG 能降低偏见。这表明,包含外部上下文有助于抵消基于刻板印象的预测,可能通过多样化模型输出的上下文 grounding 来改善公平性。为更好地理解这一现象,我们通过将链式思维(CoT)提示集成到 RAG 中并评估模型 CoT 的忠实度来探索模型的推理过程。我们的实验显示,模型的偏见倾向在检索文档提供的更多上下文信息后,在刻板印象反应和反刻板印象反应之间发生变化。有趣的是,我们发现尽管 CoT 提高了准确性,但与 RAG 降低偏见相反,它会在数据集上提高整体偏见,这凸显了需要偏见感知的推理框架以缓解这一权衡的必要性。

关键词

引用

@article{arxiv.2602.09442,
  title  = {Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts},
  author = {Shweta Parihar and Lu Cheng},
  journal= {arXiv preprint arXiv:2602.09442},
  year   = {2026}
}

备注

Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)