ScreenAgent: 一种视觉语言模型驱动的计算机控制智能体
人机交互
2025-05-27 v1 人工智能
计算机视觉与模式识别
摘要
现有的大语言模型(LLM)可以调用各种工具和API来完成复杂任务。计算机作为最强大和最通用的工具,有可能被训练好的LLM智能体直接控制。借助计算机的力量,我们有望构建一个更通用的智能体来协助人类完成各种日常数字工作。在本文中,我们构建了一个环境,使视觉语言模型(VLM)智能体能够与真实的计算机屏幕交互。在此环境中,智能体可以通过输出鼠标和键盘动作来观察屏幕截图并操作图形用户界面(GUI)。我们还设计了一个自动控制流水线,包括规划、行动和反思阶段,引导智能体持续与环境交互并完成多步骤任务。此外,我们构建了ScreenAgent数据集,该数据集收集了完成各种日常计算机任务时的屏幕截图和动作序列。最后,我们训练了一个模型ScreenAgent,它实现了与GPT-4V相当的计算机控制能力,并展示了更精确的UI定位能力。我们的尝试可以启发关于构建通用LLM智能体的进一步研究。代码可在 \url{https://github.com/niuzaisheng/ScreenAgent} 获取。
引用
@article{arxiv.2402.07945,
title = {ScreenAgent: A Vision Language Model-driven Computer Control Agent},
author = {Runliang Niu and Jindong Li and Shiqi Wang and Yali Fu and Xiyu Hu and Xueyuan Leng and He Kong and Yi Chang and Qi Wang},
journal= {arXiv preprint arXiv:2402.07945},
year = {2025}
}