面向通用计算机控制的层次化代理与多层次动作空间
人工智能
2025-09-24 v1 机器学习
摘要
通过软件控制桌面应用程序仍是一项基本且尚未得到充分服务的难题。现有的多模态大语言模型(MLLM)接受屏幕截图和任务指令以生成按键和鼠标事件,但它们 suffer from 推理延迟高、在长期稀疏奖励任务上样本效率差以及无法在设备上部署等问题。我们引入了一个轻量级层次化强化学习框架,ComputerAgent,将 OS控制建模为两个层次的选项过程(经理和子策略),采用三模态状态编码器(屏幕截图、任务ID、数值状态)来处理视觉和情境的多样性,集成带有提前停止机制的元动作以减少浪费的交互,并使用紧凑的视觉 backbone 加上小型策略网络实现设备内推理(仅1500万参数)。在135个真实世界桌面任务套件上,ComputerAgent 在简单任务(<8步)上实现了92.1%的成功率,在困难任务(≥8步)上实现了58.8%的成功率,与2000亿参数的MLLM基线相当或优于于简单场景,同时将模型规模缩小了四个数量级以上,并将推理时间缩半。这一结果表明,层次化强化学习为计算机控制提供了一种实用、可扩展的单体MLLM-based 自动化方案。
引用
@article{arxiv.2509.18230,
title = {Towards General Computer Control with Hierarchical Agents and Multi-Level Action Spaces},
author = {Zihan Dong and Xinyu Fan and Zixiang Tang and Yunqing Li},
journal= {arXiv preprint arXiv:2509.18230},
year = {2025}
}