中文

GUI Knowledge Bench: 揭示视觉语言模型在 GUI 任务中的知识差距

人工智能 2026-02-10 v2

摘要

视觉语言模型(VLMs)已推进图形用户界面(GUI)任务自动化,但仍落后于人类。我们假设这一差距源于缺失的核心 GUI 知识,而现有的训练方案(如监督微调和强化学习)单独无法完全解决。通过分析 GUI 任务执行中的常见失败模式,我们将 GUI 知识提炼为三个维度:(1)关于小部件功能、布局语义和系统状态的界面知识;(2)关于 GUI 交互类型和效果的交互知识;以及(3)关于任务目标和工作流序列的程序知识。我们进一步引入了 GUI Knowledge Bench,一个跨越六个平台(Web、Android、MacOS、Windows、Linux、IOS)和 292 个应用程序的多项选择题和是非题基准测试。我们的评估表明,当前 VLMs 通常了解各个小部件的功能,但缺乏跟踪系统状态、遵循 GUI 交互惯例和评估任务完成进度所需的 GUI 特定知识。在真实 GUI 任务上的实验进一步验证了 GUI 知识与任务成功之间的紧密联系。通过提供评估 GUI 知识的结构化框架,我们的工作支持在下游训练之前选择潜力更大的 VLMs,并为构建更强大的 GUI 智能体提供见解。

关键词

引用

@article{arxiv.2510.26098,
  title  = {GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks},
  author = {Chenrui Shi and Zedong Yu and Zhi Gao and Ruining Feng and Enqi Liu and Yuwei Wu and Yunde Jia and Liuyu Xiang and Zhaofeng He and Qing Li},
  journal= {arXiv preprint arXiv:2510.26098},
  year   = {2026}
}