中文

SteP:用于网页操作的堆叠式大语言模型策略

机器学习 2024-08-12 v4

摘要

在网页上执行任务对大语言模型(LLMs)提出了根本性挑战,包括组合爆炸般的开放世界任务以及网页界面间的差异。简单地指定一个庞大的提示来处理所有可能的行为和状态极其复杂,并会导致不相关行为之间的行为泄漏。分解为不同策略可应对此挑战,但需要仔细处理策略间的控制权交接。我们提出用于网页操作的堆叠式大语言模型策略(SteP),一种动态组合策略以解决多样化网页任务的方法。SteP 定义了一个马尔可夫决策过程,其中状态为表示控制状态的策略栈,即策略调用链。与受限于静态层次结构的传统方法不同,SteP 实现了适应任务复杂度的动态控制。我们在多个基线及网页环境(包括 WebArena、MiniWoB++ 和某 CRM)上评估 SteP。在 WebArena 上,SteP 较使用 GPT-4 策略的 SOTA 提升(14.9% 至 33.5%);而在 MiniWoB++ 上,SteP 在使用显著更少数据的情况下与先前工作具有竞争力。我们的代码与数据可在 https://asappresearch.github.io/webagents-step 获取。

关键词

引用

@article{arxiv.2310.03720,
  title  = {SteP: Stacked LLM Policies for Web Actions},
  author = {Paloma Sodhi and S. R. K. Branavan and Yoav Artzi and Ryan McDonald},
  journal= {arXiv preprint arXiv:2310.03720},
  year   = {2024}
}

备注

Accepted at Conference on Language Modeling (COLM) 2024. 30 pages, 15 figures