超越十轮对话:利用大规模异步强化学习解锁长程智能体搜索
计算与语言
2025-10-28 v4 人工智能
摘要
基于大语言模型(LLM)的智能体通过集成外部工具,在处理复杂的知识密集型任务方面展现了卓越的能力。在众多工具选择中,搜索工具在访问海量外部知识方面扮演着关键角色。然而,开源智能体在达到专家级搜索智能方面仍有不足,搜索智能是指解决模糊查询、生成精确搜索、分析结果并进行深入探索的能力。现有方法在可扩展性、效率和数据质量方面存在不足。例如,现有在线强化学习方法中的轮次限制(例如小于等于10)限制了复杂策略的学习。本文介绍了 ASearcher,一个用于大规模强化学习训练搜索智能体的开源项目。我们的主要贡献包括:(1) 可扩展的完全异步强化学习训练,能够实现长程搜索,同时保持高训练效率。(2) 一个基于提示的 LLM 智能体,能够自主合成高质量且具有挑战性的问答对,从而创建大规模 QA 数据集。通过强化学习训练,我们基于提示的 QwQ-32B 智能体取得了显著改进,在 xBench 和 GAIA 上的 Avg@4 指标分别提升了 78.0% 和 34.3%。值得注意的是,我们的智能体展现了极长的搜索范围,在训练期间工具调用超过 100 轮,输出 token 超过 400k。凭借简单的智能体设计且不使用外部 LLM,ASearcher-Web-QwQ 在 xBench 和 GAIA 上分别取得了 51.1 和 58.7 的 Avg@4 分数,超越了现有的开源 32B 智能体。最后,我们还展示了 ASearcher-Web-QwQ 能够以零样本迁移的方式,通过测试时搜索,达到使用外部摘要工具的商业系统的性能。我们在 https://github.com/inclusionAI/ASearcher 开源了我们的模型、训练数据和代码。
引用
@article{arxiv.2508.07976,
title = {Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL},
author = {Jiaxuan Gao and Wei Fu and Minyang Xie and Shusheng Xu and Chuyi He and Zhiyu Mei and Banghua Zhu and Yi Wu},
journal= {arXiv preprint arXiv:2508.07976},
year = {2025}
}