中文

应对 RAG 中噪声过滤的内在困难

计算与语言 2026-01-07 v2 人工智能

摘要

检索增强生成(RAG)已成为通过融合外部知识来增强大型语言模型(LLM)并减少幻觉信息的广泛采纳方法。然而,RAG 过程中常会引入噪声或无关文档,可能降低性能甚至导致幻觉输出。虽然已提出多种方法来过滤掉此类噪声,但我们认为,从检索内容中识别无关信息是本质上困难的,而且有限的 transformer 层几乎无法解决此问题。因此,检索器难以完全过滤掉无关文档。为此,LLM 必须具备抗噪能力,但我们展示了标准的微调方法往往无效,因注意力模式的结构限制,模型难以在检索文档中选择性地利用相关信息而忽略无关内容。为此,我们提出了一种新颖的微调方法,旨在增强模型区分检索文档中相关与无关信息的能力。广泛的实验表明,我们的方法显著提高了 LLM 的鲁棒性和性能。

关键词

引用

@article{arxiv.2601.01896,
  title  = {Tackling the Inherent Difficulty of Noise Filtering in RAG},
  author = {Jingyu Liu and Jiaen Lin and Yong Liu},
  journal= {arXiv preprint arXiv:2601.01896},
  year   = {2026}
}