中文

基于执行反馈强化学习训练高层调度器用于长期程度 GUI 自动化

人工智能 2026-03-05 v2

摘要

大型视觉语言模型(VLM)的快速发展极大推动了 GUI 智能体的研究,但 GUI 智能体在处理长期程度任务方面仍面临显著挑战。首先,单一智能体模型在平衡高层次能力与低层次执行能力方面困难,常出现职责耦合和能力冲突问题。其次,智能体缺乏对任务状态的 awareness,导致在长期程度任务中出现进度损失。为此,我们提出了一种分阶段执行反馈强化学习算法。不同于训练统一的策略模型,我们聚焦于训练高层次调度模型。具体而言,我们提出并训练了两个智能体:负责战略规划和任务分解的 Coordinator;负责上下文压缩和信息管理,以维持任务状态和连贯性的 State Tracker。基于此,我们构建了 Coordinator-Executor-State Tracker(CES)多智能体框架,可与任何低层次 Executor 模型集成,通过任务调度和状态管理辅助 Executor 解决长期程度任务。实验在长期程度任务基准上表明,CES显著提升了系统的规划和状态管理能力。进一步分析确认,我们训练的高层次调度模块是一种可通用化、即插即用的数据模块,显著提升了各种 Executor 的长期程度能力。代码可在 https://github.com/hehehahi4/CES 查看。

关键词

引用

@article{arxiv.2511.22235,
  title  = {Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation},
  author = {Zehao Deng and Tianjie Ju and Zheng Wu and Zhuosheng Zhang and Gongshen Liu},
  journal= {arXiv preprint arXiv:2511.22235},
  year   = {2026}
}

备注

Accepted to CVPR 2026