WebSailor: 为网页智能体导航超人类推理
计算与语言
2025-07-04 v1 人工智能
摘要
超越人类认知局限是 LLM 训练的关键前沿。专有代理系统如 DeepResearch 已在极其复杂的信息寻求基准测试(如 BrowseComp)上展示出超人类能力,这是此前难以实现的。我们认为,这些成功的关键在于缺乏于开源模型中的一种新型推理模式:即在导航广阔信息景观时,系统性地降低极端不确定性的能力。基于此洞见,我们提出 WebSailor,这是一套完整的后训练方法,旨在培养这种关键能力。我们的方法通过结构化抽样和信息遮蔽生成新颖的高不确定性任务,进行 RFT 冷启动,以及一种高效的代理 RL 训练算法——复制抽样策略优化(DUPO)。通过这一集成管道,WebSailor 在复杂信息寻求任务中显著优于所有开源代理,匹配专有代理的性能,缩小了能力差距。
引用
@article{arxiv.2507.02592,
title = {WebSailor: Navigating Super-human Reasoning for Web Agent},
author = {Kuan Li and Zhongwang Zhang and Huifeng Yin and Liwen Zhang and Litu Ou and Jialong Wu and Wenbiao Yin and Baixuan Li and Zhengwei Tao and Xinyu Wang and Weizhou Shen and Junkai Zhang and Dingchu Zhang and Xixi Wu and Yong Jiang and Ming Yan and Pengjun Xie and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2507.02592},
year = {2025}
}