中文

WebAnchor:通过锚定代理规划来稳定长期视网膜推理

计算与语言 2026-01-08 v2

摘要

基于大型语言模型 (LLM) 的智能体在网页信息检索方面展现出强大的能力,而强化学习 (RL) 正成为关键的优化范式。然而,规划仍是一个瓶颈,因为现有方法在处理长期策略时表现不佳。我们的分析揭示了一个关键现象,即“计划锚定”现象:在长期视网膜推理任务中,第一步推理对下游行为的影响占据决定性地位。当前的 RL 算法未能考虑这一点,而是在轨迹上均匀分配奖励。为此,我们提出 Anchor-GRPO,一个两阶段的 RL 框架,通过解耦规划与执行来应对。阶段 1 中,智能体利用来自自我对弈经验和人类校准的细粒度评估标准优化其第一步规划。在阶段 2,通过稀疏奖励确保执行与初始计划相匹配,从而实现稳定且高效的工具使用。我们在四个基准测试上评估了 Anchor-GRPO:BrowseComp、BrowseComp-Zh、GAIA 和 XBench-DeepSearch。在 3B 至 30B 的模型规模上,Anchor-GRPO 超越基线 GRPO 和 First-step GRPO,提升了任务成功率和工具效率。值得注意的是,WebAnchor-30B 在 BrowseComp 上实现了 46.0% 的 pass@1,在 GAIA 上实现了 76.4%。Anchor-GRPO 还显示出强大的可扩展性,随模型规模和上下文长度的增加,准确率也随之提升。

关键词

引用

@article{arxiv.2601.03164,
  title  = {WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning},
  author = {Xinmiao Yu and Liwen Zhang and Xiaocheng Feng and Yong Jiang and Bing Qin and Pengjun Xie and Jingren Zhou},
  journal= {arXiv preprint arXiv:2601.03164},
  year   = {2026}
}