中文

规划方式是否重要?面向LLM网页代理的规划表示实证研究

计算与语言 2026-05-29 v1 人工智能 机器学习

摘要

尽管近期进展显著,基于LLM的网页代理仍面临探索有限、关键步骤遗漏以及对任务约束敏感等问题。先前工作表明,这些失败许多源于规划弱点,但替代性自然语言规划表示的影响尚未被探讨。为此,我们引入PlanAhead,一个静态规划-执行框架,评估规划表示对代理性能的影响。我们首先自动将WebArena任务划分为3个难度级别,实现无需人工标注的一致难度评估。随后系统评估了顺序子目标、叙事、伪代码和清单四种不同规划表示在难度较高的任务上的表现;同时覆盖来自OpenAI、阿里巴巴和Google的不同族系多模态LLM代理。为消除随机变异性,我们引入两种新评估指标:实现率(Achievement Rate, AR)和解题一致性(Solved-Task Consistency, STC)。我们的结果表明,规划表述方式以及生成规划的底层LLM,均显著影响网页代理的鲁棒性和任务成功率。

关键词

引用

@article{arxiv.2605.29927,
  title  = {Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents},
  author = {Alejandra Zambrano and Sara Vera Marjanovic and Imene Kerboua and Xing Han Lù and Leila Kosseim},
  journal= {arXiv preprint arXiv:2605.29927},
  year   = {2026}
}

备注

Extended version of paper submitted to EMNLP, waiting for acceptance