中文

VEM:基于价值环境模型的无环境探索训练 GUI 智能体

机器学习 2025-02-27 v1

摘要

通过强化学习(RL)训练用于图形用户界面(GUI)智能体的视觉-语言模型(VLM)面临关键挑战:基于环境的 RL 需要昂贵的交互,而无环境方法则在分布偏移和奖励泛化方面存在困难。我们提出一种无环境的 RL 框架,通过利用预训练的价值环境模型(VEM)将价值估计与策略优化解耦。VEM 直接从离线数据中预测状态-动作值,提取关于 GUI 交互结果的人类先验知识,无需下一状态预测或环境反馈。这避免了误差累积,并通过聚焦语义推理(例如,该动作是否推进了用户目标?)增强了对 UI 变化的鲁棒性。该框架分两个阶段运行:(1)预训练 VEM 以估计长期动作效用,(2)利用冻结的 VEM 信号引导策略探索,从而实现与布局无关的 GUI 自动化。在 Android-in-the-Wild 基准上评估,VEM 在离线和在线设置中均达到最先进的性能,显著优于无环境基线,并在无交互成本的情况下匹配基于环境的方法。重要的是,VEM 表明语义感知的价值估计可以与在线训练方法达到可比性能。

关键词

引用

@article{arxiv.2502.18906,
  title  = {VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model},
  author = {Jiani Zheng and Lu Wang and Fangkai Yang and Chaoyun Zhang and Lingrui Mei and Wenjie Yin and Qingwei Lin and Dongmei Zhang and Saravan Rajmohan and Qi Zhang},
  journal= {arXiv preprint arXiv:2502.18906},
  year   = {2025}
}

备注

20pages,5 figures