中文

领域感知的检索增强生成:基于损失混合增强强化学习的高效训练与可扩展检索

计算与语言 2025-09-09 v1 信息检索

摘要

检索增强生成(RAG)系统高度依赖检索阶段,尤其是粗排过程。现有的粗排优化方法往往难以在领域特定知识学习与查询增强之间取得平衡,导致检索性能欠佳。为应对这一挑战,我们提出 MoLER,一种领域感知的 RAG 方法,利用损失混合(MoL)增强的强化学习来优化检索。MoLER 采用两阶段流程:持续预训练(CPT)阶段使用损失混合(MoL)来平衡领域特定知识与通用语言能力,以及强化学习(RL)阶段利用分组相对策略优化(GRPO)来优化查询与段落生成,以最大化文档召回率。一个关键创新是我们的多查询单段落后期融合(MSLF)策略,该策略在 RL 训练期间降低了计算开销,同时通过多查询多段落后期融合(MMLF)保持可扩展的推理。在基准数据集上的大量实验表明,MoLER 达到了最先进的性能,显著优于基线方法。MoLER 弥合了 RAG 系统中的知识鸿沟,从而在专业领域实现了鲁棒且可扩展的检索。

关键词

引用

@article{arxiv.2509.06650,
  title  = {Domain-Aware RAG: MoL-Enhanced RL for Efficient Training and Scalable Retrieval},
  author = {Hao Lin and Peitong Xie and Jingxue Chen and Jie Lin and Qingkun Tang and Qianchun Lu},
  journal= {arXiv preprint arXiv:2509.06650},
  year   = {2025}
}