s3:无需大量数据即可通过强化学习训练搜索智能体
人工智能
2025-11-06 v2 计算与语言
摘要
检索增强生成(RAG)系统使大语言模型(LLM)能够在推理时访问外部知识。最近的进展使LLM能够通过强化学习(RL)充当搜索智能体,通过与检索引擎的多轮交互来改进信息获取。然而,现有方法要么使用仅关注下游实用性的搜索专用指标(如NDCG)进行检索优化,要么对整个LLM进行微调以联合推理和检索,导致检索与生成 entangled,限制了实际搜索实用性和与冻结或专有模型的兼容性。在本文中,我们提出了s3,一个轻量级、模型无关的框架,将检索器与生成器解耦,并使用Gain Beyond RAG奖励训练检索器:即对 naive RAG的生成准确性提升的增益。s3仅需要2400个训练样本即可超过在70倍以上数据上训练的基线方法,在六个通用问答基准和五个医学问答基准上持续实现更强的下游性能。
引用
@article{arxiv.2505.14146,
title = {s3: You Don't Need That Much Data to Train a Search Agent via RL},
author = {Pengcheng Jiang and Xueqiang Xu and Jiacheng Lin and Jinfeng Xiao and Zifeng Wang and Jimeng Sun and Jiawei Han},
journal= {arXiv preprint arXiv:2505.14146},
year = {2025}
}
备注
EMNLP 2025 camera-ready