GUI 动作叙述器:该在哪里、何时发生了该动作?
计算机视觉与模式识别
2024-06-21 v1
摘要
多模态大语言模型的出现显著提升了图像 OCR 识别能力,使 GUI 自动化成为提高数字任务效率的可行方案。开发 GUI 自动化系统的关键基本方面之一是理解原始 GUI 动作。这一理解至关重要,因为它使智能体能够从用户演示中学习,这是自动化的关键要素。为严格评估此类能力,我们开发了一个由 4,189 个多样化视频叙述样本组成的 GUI 动作视频叙述基准。该任务在自然场景视频叙述方面的独特挑战:1)GUI 屏幕截图通常包含比自然场景更密集的信息;2)GUI 中的事件更细微且发生得更快,需要对适当的时间范围和空间区域进行精确注意以实现准确理解。为此,我们引入了名为 Act2Cap 的 GUI 动作数据集,以及一个简单而有效的框架 Act2Cap,用于 GUI 视频叙述,该框架利用光标作为视觉提示以增强对高分辨率屏幕截图的解释。具体而言,一个在我们的数据集上训练的光标检测器,以及一个机制用于选择关键帧和关键区域的多模态大语言模型模型生成叙述。实验结果表明,即便对于今天最先进的多模态模型如 GPT-4o,此任务仍然高度具有挑战性。此外,我们的评估显示,我们的策略有效地提升了模型性能,无论是集成到开源模型的微调中,还是作为封闭源模型的提示策略中。
引用
@article{arxiv.2406.13719,
title = {GUI Action Narrator: Where and When Did That Action Take Place?},
author = {Qinchen Wu and Difei Gao and Kevin Qinghong Lin and Zhuoyu Wu and Xiangwu Guo and Peiran Li and Weichen Zhang and Hengxu Wang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2406.13719},
year = {2024}
}