中文

区分谷与粟:Winnowing Divergent Views in Retrieval Augmented Generation

计算与语言 2025-11-10 v1 人工智能

摘要

检索增强生成(RAG)通过整合外部知识源来增强大语言模型(LLM),以解决其无法获取最新或专业信息的局限性。增加检索相关文档的数量是提高获取相关信息概率的自然策略,但涉及更多文档可能引入显著噪声,因为许多文档可能无关或误导,从而降低生成响应的整体准确性。为克服处理大量文档的挑战,我们提出了 WinnowRAG—a 一种新型 RAG 框架,旨在系统性地过滤噪声文档,同时保留有价值内容——我们称之为筛选。WinnowRAG 在两个阶段运行:在阶段 I 中,我们执行查询感知聚类,以分组相似文档并形成 distinct 主题聚类。每个聚类被分配给一个 LLM 智能体用于生成唯一答案。在阶段 II 中,我们执行筛选,其中批判性 LLM 对多个智能体的输出进行评估,并迭代分离有用文档与噪声文档。为在丢弃智能体时保留有用文档,我们提出了两种战略性合并技术,以确保仅使用相关知识生成最终响应。关键的是,WinnowRAG 是模型无关的,不需要任何模型微调,使其易于适用于各种任务。广泛的在各种现实数据集上的实验表明,WinnowRAG 在最先进的基线方法上具有有效性。

关键词

引用

@article{arxiv.2511.04700,
  title  = {Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation},
  author = {Song Wang and Zihan Chen and Peng Wang and Zhepei Wei and Zhen Tan and Yu Meng and Cong Shen and Jundong Li},
  journal= {arXiv preprint arXiv:2511.04700},
  year   = {2025}
}

备注

EMNLP Main 2025