SKILL-RAG:基于自我知识驱动的检索增强生成学习与过滤方法
计算与语言
2025-09-26 v1 人工智能
摘要
检索增强生成(RAG)在近年来显著优于大语言模型(LLM)在知识密集型任务上的性能。然而,由于检索系统可能返回无关内容,将此类信息纳入模型常会导致幻觉现象。因此,识别并过滤无用检索内容是提升RAG性能的关键挑战。为更好地整合模型的内部知识与检索获取的外部知识,必须理解模型“知道”与“不知道”的范围(亦即“自我知识”)。基于此洞见,我们提出了SKILL-RAG(Self-Knowledge Induced Learning and Filtering for RAG),一种 novel 方法,利用模型的自我知识来确定哪些检索文档对解答给定查询有益。我们设计了基于强化学习的训练框架,以显式引导模型展现自我知识,并采用句子级别的粒度过滤无关内容,同时保留有用知识。我们使用 Llama2-7B 和 Qwen3-8B 在多个问答基准测试上评估了 SKILL-RAG。实验结果表明,SKILL-RAG 不仅提升了生成质量,还显著减少了输入文档的数量,验证了自我知识在引导高质量检索选择方面的重要性。
引用
@article{arxiv.2509.20377,
title = {SKILL-RAG: Self-Knowledge Induced Learning and Filtering for Retrieval-Augmented Generation},
author = {Tomoaki Isoda},
journal= {arXiv preprint arXiv:2509.20377},
year = {2025}
}