中文

DebiasRAG:一种通过检索增强生成实现大语言模型公平生成的无调优路径

计算与语言 2026-05-18 v1 人工智能

摘要

大语言模型(LLMs)因其卓越的生成能力取得了前所未有的成功。然而,由于它们依赖于从训练语料库中封装的知识,可能会产生幻觉、刻板印象和社会偏见内容。特别是,LLMs容易产生涉及种族、性别和年龄的偏见性回应,这些统称为社会偏见。先前的研究已使用微调和提示工程来减轻LLMs中的此类偏见,但这些方法需要额外的训练资源或领域知识来设计框架。此外,它们可能会降低LLMs的原始能力,并且常常忽视了为更公平的推理而需要动态去偏上下文的必要性。在本文中,我们提出了DebiasRAG,这是一种新颖的、无需调优的、动态的、查询特定的去偏框架,它基于检索增强生成(RAG)。DebiasRAG在保持LLMs固有属性(如表示能力)的同时,提高了公平性。DebiasRAG由三个阶段组成:(1)查询特定的去偏候选生成;(2)上下文候选池构建;(3)梯度更新的去偏引导上下文片段重排序。首先,DebiasRAG通过常规检索,利用与查询相关的自我诊断的偏见上下文,这些偏见上下文由DebiasRAG提供者离线准备。给定查询特定的偏见上下文,DebiasRAG反向生成去偏上下文,这些上下文作为LLM输出的额外公平性约束。其次,常规的RAG检索过程从常规RAG文档数据库(如分块的维基百科数据集)中生成与查询相关的上下文。

关键词

引用

@article{arxiv.2605.16113,
  title  = {DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation},
  author = {Rui Chu and Bingyin Zhao and Thanh Quoc Hung Le and Duy Cao Hoang and Huawei Lin and Ping Li and Weijie Zhao and Khoa D Doan and Yingjie Lao},
  journal= {arXiv preprint arXiv:2605.16113},
  year   = {2026}
}