RichRAG:为检索增强生成中的多层面查询构建丰富响应
计算与语言
2025-02-18 v3
摘要
检索增强生成(RAG)有效解决了大型语言模型中静态知识和幻觉的问题。现有研究大多集中在用户意图明确、答案简洁的问答场景。然而,用户经常提出宽泛、开放式的查询,其中包含多种子意图,他们期望获得涵盖多个相关方面的丰富且长篇的答案。为了解决这个重要但尚未充分探索的问题,我们提出了一种新颖的RAG框架,即RichRAG。它包括一个子方面探索器,用于识别输入问题的潜在子方面;一个多层面检索器,用于构建与这些子方面相关的多样化外部文档候选池;以及一个生成式列表排序器,这是一个关键模块,用于为最终生成器提供最有价值的top-k文档。这些排序后的文档充分覆盖了查询的各个方面,并感知了生成器的偏好,从而激励其为用户生成丰富且全面的响应。我们的排序器训练包括一个监督微调阶段,以确保文档的基本覆盖,以及一个强化学习阶段,以使下游LLM的偏好与文档排序对齐。在两个公开数据集上的实验结果证明,我们的框架能够有效且高效地为用户提供全面且令人满意的响应。
引用
@article{arxiv.2406.12566,
title = {RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation},
author = {Shuting Wang and Xin Yu and Mang Wang and Weipeng Chen and Yutao Zhu and Zhicheng Dou},
journal= {arXiv preprint arXiv:2406.12566},
year = {2025}
}