WebSailor-V2:通过合成数据和可扩展强化学习桥接至专有代理
机器学习
2025-09-17 v1 计算与语言
摘要
超越人类认知局限是 LLM 训练中的关键前沿。专有代理系统如 DeepResearch 已在极其复杂的信息寻求基准(如 BrowseComp)上展示出超人类能力,这是此前难以实现的。我们认为,这些成功的关键在于开源模型所缺乏的一种精妙推理模式:在导航广阔信息景观时系统性地减少极端不确定性的能力。基于这一洞见,我们引入了 WebSailor,这是一套完整的后训练方法,旨在灌输这种关键能力。我们的做法涉及通过结构化抽样和信息遮蔽生成新型高不确定性任务、RFT 冷启动,以及一种高效的代理强化学习训练算法——Duplicating Sampling Policy Optimization(DUPO)。通过这一集成管道,WebSailor 在复杂信息寻求任务中显著优于所有开源代理,匹配专有代理的性能,弥合了能力差距。
引用
@article{arxiv.2509.13305,
title = {WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning},
author = {Kuan Li and Zhongwang Zhang and Huifeng Yin and Rui Ye and Yida Zhao and Liwen Zhang and Litu Ou and Dingchu Zhang and Xixi Wu and Jialong Wu and Xinyu Wang and Zile Qiao and Zhen Zhang and Yong Jiang and Pengjun Xie and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2509.13305},
year = {2025}
}
备注
https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/