超越单查询限制:利用强化学习为 LLM 训练查询扩展
计算与语言
2025-10-14 v1 人工智能
信息检索
摘要
推理增强搜索代理(如 Search-R1)被训练进行推理、搜索和迭代生成最终答案。然而,由于其在推理和搜索方面的有限能力,其在多跳问答基准测试上的表现仍远远不够理想。为了处理复杂或复合查询,我们通过强化学习训练了一个具备查询扩展原生能力的 LLM-based 搜索代理。在每一轮中,您的搜索代理提出几个查询变体,这些查询会同时被搜索,以覆盖更多相关信息。同时,鉴于有限的后训练数据和计算资源,搜索代理掌握多个任务(包括查询生成、检索信息理解和答案生成)都颇具挑战。因此,我们提出了纳入预训练的压缩模型,以帮助搜索代理理解检索到的文档,使搜索代理能够专注于查询生成以实现更高的检索召回率。借助压缩模型的帮助,我们发现即使是小规模的 3B LLM 也能展示查询扩展的强大能力,并在多跳问答基准测试上实现最先进的准确率。具体而言,我们跨七个问答基准测试的实验表明,我们的方法称为 ExpandSearch,相较于最先进的基线方法实现平均提升 4.4%,在需要多样化证据聚合的多跳推理任务上取得显著提升。
引用
@article{arxiv.2510.10009,
title = {Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning},
author = {Shu Zhao and Tan Yu and Anbang Xu},
journal= {arXiv preprint arXiv:2510.10009},
year = {2025}
}