PAIRS:面向高效检索增强生成的参数验证自适应信息检索与选择
计算与语言
2025-08-07 v1
摘要
检索增强生成(Retrieval-Augmented Generation, RAG)已成为增强大型语言模型(LLM)外部知识的核心技术。然而,当前 RAG 系统面临两个关键局限:(1)对每个查询都进行信息检索,包括可仅凭 LLM 参数知识解决的简单问题,效率低下;(2)当查询信号稀疏时,风险检索到无关文档。为此,我们引入参数验证自适应信息检索与选择(Parametric-verified Adaptive Information Retrieval and Selection, PAIRS),一个无训练框架,集成参数与检索知识,自适应确定是否检索及如何选择外部信息。具体而言,PAIRS 采用双路径生成机制:首先,LLM 同时生成直接答案和基于自生成伪上下文的上下文增强答案。当这两者收敛时,PAIRS 完全跳过外部检索,显著提升 RAG 系统效率。对于发散情况,PAIRS 激活双路径检索(Dual-Path Retrieval, DPR)过程,由原始查询与自生成上下文信号共同指引,随后通过加权相似度与两个来源的上下文进行过滤的自适应信息选择(Adaptive Information Selection, AIS)模块。该方法简单却有效,不仅消除不必要检索显著提升效率,还通过上下文引导检索和自适应信息选择提升准确性。在六个问答基准测试中,实验结果表明,PAIRS 将检索成本降低约25%(仅触发75%的查询),同时在准确性方面相较于先前基线提升+1.1% EM 和 +1.0% F1。
引用
@article{arxiv.2508.04057,
title = {PAIRS: Parametric-Verified Adaptive Information Retrieval and Selection for Efficient RAG},
author = {Wang Chen and Guanqiang Qi and Weikang Li and Yang Li and Deguo Xia and Jizhou Huang},
journal= {arXiv preprint arXiv:2508.04057},
year = {2025}
}