中文

CogAgent:面向 GUI 智能体的视觉语言模型

计算机视觉与模式识别 2024-12-30 v3

摘要

人们通过图形用户界面(GUI),例如计算机或智能手机屏幕,在数字设备上花费了大量时间。诸如 ChatGPT 之类的大型语言模型(LLM)可以协助人们完成撰写电子邮件等任务,但在理解和交互 GUI 方面存在困难,从而限制了其提升自动化水平的潜力。在本文中,我们介绍了 CogAgent,一个拥有 180 亿参数、专用于 GUI 理解与导航的视觉语言模型(VLM)。通过同时利用低分辨率和高分辨率图像编码器,CogAgent 支持 1120*1120 分辨率的输入,使其能够识别微小的页面元素和文本。作为通用视觉语言模型,CogAgent 在五个文本丰富和四个通用 VQA 基准上达到了 state-of-the-art,包括 VQAv2、OK-VQA、Text-VQA、ST-VQA、ChartQA、infoVQA、DocVQA、MM-Vet 和 POPE。CogAgent 仅使用截图作为输入,在 PC 和 Android GUI 导航任务 Mind2Web 和 AITW 上均优于使用提取 HTML 文本的基于 LLM 的方法,推进了 state-of-the-art。模型和代码可在 https://github.com/THUDM/CogVLM 获取,新版本 CogAgent-9B-20241220 可在 https://github.com/THUDM/CogAgent 获取。

关键词

引用

@article{arxiv.2312.08914,
  title  = {CogAgent: A Visual Language Model for GUI Agents},
  author = {Wenyi Hong and Weihan Wang and Qingsong Lv and Jiazheng Xu and Wenmeng Yu and Junhui Ji and Yan Wang and Zihan Wang and Yuxuan Zhang and Juanzi Li and Bin Xu and Yuxiao Dong and Ming Ding and Jie Tang},
  journal= {arXiv preprint arXiv:2312.08914},
  year   = {2024}
}

备注

CVPR 2024 (Highlight), 27 pages, 19 figures