中文

WebCoT:通过在反思、分支与回溯中重构思维链来增强Web智能体推理能力

计算与语言 2025-09-19 v2

摘要

由大语言模型(LLM)驱动的Web智能体展现出成为下一代人工智能的潜力,但其在不确定、动态的Web环境中有限的推理能力阻碍了稳健部署。在本文中,我们识别了有效Web智能体所需的关键推理技能,即反思与前瞻、分支和回溯,并通过将智能体的(推理时)推理算法重构为思维链依据,整理了体现这些能力的轨迹数据。我们在智能体自我提升基准OpenWebVoyager中进行了实验,并证明通过简单的微调将显著推理模式蒸馏到骨干LLM中可以大幅提升其性能。我们的方法在多个基准上取得了显著提升,包括WebVoyager、Mind2web-live和SimpleQA(网络搜索),突显了针对Web智能体的定向推理技能增强的潜力。

关键词

引用

@article{arxiv.2505.20013,
  title  = {WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback},
  author = {Minda Hu and Tianqing Fang and Jianshu Zhang and Junyu Ma and Zhisong Zhang and Jingyan Zhou and Hongming Zhang and Haitao Mi and Dong Yu and Irwin King},
  journal= {arXiv preprint arXiv:2505.20013},
  year   = {2025}
}

备注

18 pages