VideoGUI: 基于 instructional 视频的 GUI 自动化基准
计算机视觉与模式识别
2024-06-17 v1 人工智能
摘要
GUI 自动化技术对于提高人类生产力、协助完成计算机任务具有巨大的潜力。现有的任务表述主要聚焦于由单个语言指令指定的简单任务,例如“插入新幻灯片”。本文引入了 VideoGUI,一个 novel 多模态基准,用于评估 GUI 助手在基于视觉的 GUI 任务上的表现。该基准来源于高质量的 web instructional 视频,关注专业和 novel 软件(如 Adobe Photoshop 或 Stable Diffusion WebUI)以及复杂活动(如视频编辑)的任务。VideoGUI 通过分层过程评估 GUI 助手,识别其在各个层次上的表现瓶颈:(i) 高层计划:在无语言描述的情况下从视觉条件重建程序子任务;(ii) 中层计划:基于视觉状态(即屏幕截图)和目标生成精确的动作叙述序列;(iii) 原子动作执行:执行特定动作,如精准点击指定元素。对于每个层次,我们设计了跨维度的评估指标,以提供清晰的信号,例如在原子动作执行中的点击、拖拽、输入和滚动等 individual 性能。我们在 VideoGUI 上的评估表明,即便是最先进的大型多模态模型 GPT4o 在视觉导向的 GUI 任务上也表现不佳,尤其是在高层计划方面。
引用
@article{arxiv.2406.10227,
title = {VideoGUI: A Benchmark for GUI Automation from Instructional Videos},
author = {Kevin Qinghong Lin and Linjie Li and Difei Gao and Qinchen WU and Mingyi Yan and Zhengyuan Yang and Lijuan Wang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2406.10227},
year = {2024}
}
备注
24 pages, 16 tables, 17 figures