SmartRAG:从环境反馈中联合学习RAG相关任务
信息检索
2025-03-11 v2 人工智能
计算与语言
摘要
RAG系统由多个模块协同工作。然而,这些模块通常是分开训练的。我们认为,像RAG这样包含多个模块的系统应该进行联合优化,以达到最佳性能。为了证明这一点,我们设计了一个名为\textbf{SmartRAG}的特定流水线,它包含一个策略网络和一个检索器。策略网络可以充当:1) 决定何时检索的决策者,2) 生成最适合检索器的查询的查询重写器,以及3) 在有/无观测结果的情况下生成最终响应的答案生成器。然后,我们提出使用强化学习算法联合优化整个系统,其奖励设计旨在鼓励系统以最小的检索成本实现最佳性能。当联合优化时,所有模块都能感知其他模块的工作方式,从而找到作为完整系统协同工作的最佳方式。实验结果表明,联合优化的SmartRAG能够取得比分开优化的对应系统更好的性能。
引用
@article{arxiv.2410.18141,
title = {SmartRAG: Jointly Learn RAG-Related Tasks From the Environment Feedback},
author = {Jingsheng Gao and Linxu Li and Weiyuan Li and Yuzhuo Fu and Bin Dai},
journal= {arXiv preprint arXiv:2410.18141},
year = {2025}
}