中文

面向 LLM 基于图形用户界面自动化的动态规划

人工智能 2024-12-20 v3 人机交互

摘要

大型语言模型 (LLM) 的兴起促进了对基于 LLM 的自主智能体的广泛关注,尤其是在智能手机图形用户界面 (GUI) 应用场景。当面临任务目标时,这些智能体通常会在 GUI 环境中模拟人类动作,直至完成任务。然而,关键挑战在于设计有效的计划以指导 GUI 任务中的动作预测,尽管规划被广泛认为是将复杂任务分解为系列步骤的有效方法。具体而言,鉴于执行动作后环境 GUI 的动态特性,必须根据环境反馈和动作历史动态调整计划。我们发现,广泛使用的 ReAct 方法因历史对话过度而失败。为解决此挑战,我们提出了一种新方法,称为基于 LLM 的 GUI 智能体的动态思考规划 (D-PoT)。D-PoT 包括根据环境反馈和执行历史进行动态规划调整。实验结果表明,所提出的 D-PoT 在准确率上显著优于强大的 GPT-4V 基线,提升了 +12.7%(从 34.66% 提升至 47.36%)。分析表明,动态规划在不同主干 LLM 中具有普适性,并且有助于减轻幻觉并适应未见任务。代码已公开于 https://github.com/sqzhang-lazy/D-PoT。

关键词

引用

@article{arxiv.2410.00467,
  title  = {Dynamic Planning for LLM-based Graphical User Interface Automation},
  author = {Shaoqing Zhang and Zhuosheng Zhang and Kehai Chen and Xinbei Ma and Muyun Yang and Tiejun Zhao and Min Zhang},
  journal= {arXiv preprint arXiv:2410.00467},
  year   = {2024}
}

备注

EMNLP 2024