AceSearcher:通过强化自我对弈为大语言模型引导推理与搜索
计算与语言
2025-09-30 v1 人工智能
信息检索
机器学习
摘要
搜索增强型大语言模型(LLM)常因多跳检索无效以及推理能力有限而在复杂推理任务中表现不佳。我们提出AceSearcher,一个合作式自我对弈框架,训练单个大语言模型(LLM)在两个角色之间交替:一个分解器负责拆分复杂查询,一个求解器负责整合检索到的上下文以生成答案。AceSearcher将监督微调与强化微调相结合,后者针对最终答案的准确性进行优化,无需中间标注。针对三个推理密集型任务中的10个数据集进行大量实验,表明AceSearcher在状态机构基线上 outperform,平均准确率提升7.6%。惊人的是,在文档级金融推理任务中,AceSearcher-32B模型的性能可与DeepSeek-V3相当,却使用了其参数的不到5%。即使在较小规模(1.5B和8B)下,AceSearcher也常常超越使用最高多达9倍参数的现有搜索增强型LLM,凸显其在处理复杂推理任务方面的卓越效率与效果。我们的代码将发布于https://github.com/ritaranx/AceSearcher和https://huggingface.co/AceSearcher。
引用
@article{arxiv.2509.24193,
title = {AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play},
author = {Ran Xu and Yuchen Zhuang and Zihan Dong and Jonathan Wang and Yue Yu and Joyce C. Ho and Linjun Zhang and Haoyu Wang and Wenqi Shi and Carl Yang},
journal= {arXiv preprint arXiv:2509.24193},
year = {2025}
}
备注
Accepted to NeurIPS 2025 (Spotlight)