DACL-RAG:基于课程学习的数据增强策略用于检索增强生成
计算与语言
2025-10-07 v2
摘要
检索增强生成(RAG)是提高大语言模型(LLM)能力的有效方法。现有方法通常通过直接使用前k个检索文档来优化RAG系统中的检索器或生成器。然而,训练数据中存在两个关键问题限制了该训练范式的有效性:(1)在不同查询之间,前k个检索文档的内容质量差异很大,一些提供有价值的知识,而另一些则缺乏关键信息甚至是误导性的;在纯随机 manner 上训练数据可能损害生成器提取关键信息的能力;(2)对于给定查询,限定的k个文档往往判别性较低,仅凭这些文档进行训练使检索器难以学习区分相关与不相关文档的能力。为此,我们引入DACL-RAG,这是一个结合多级数据增强策略与多阶段课程学习范式的多阶段RAG训练框架。数据增强策略通过样本演化构建具有可控难度水平的全面且多样化训练集,而课程学习范式将其组织为分阶段进行训练,确保稳定且持续的性能提升,从而更有效地优化RAG系统的整体性能与泛化能力。我们的DACL-RAG框架在四个开放域问答数据集上均表现出一致的有效性,相较于多种先进方法实现了2%至4%的性能提升。
引用
@article{arxiv.2505.10493,
title = {DACL-RAG: Data Augmentation Strategy with Curriculum Learning for Retrieval-Augmented Generation},
author = {Shaohan Wang and Licheng Zhang and Zheren Fu and Zhendong Mao and Yongdong Zhang},
journal= {arXiv preprint arXiv:2505.10493},
year = {2025}
}