面向任意位置的屏幕阅读:基于树状镜头对齐的布局感知 GUI 屏幕阅读
计算与语言
2024-10-29 v2 计算机视觉与模式识别
摘要
图形用户界面 (GUI) 是我们与数字设备交互的核心方式,正在积极构建模型以解决各种 GUI 理解任务。然而,这些努力很少关注一种重要的 GUI 引用任务:基于用户指定位置的屏幕阅读,我们称之为屏幕点阅读 (Screen Point-and-Read, ScreenPR) 任务。当前,该任务主要由僵化的可访问屏幕阅读工具处理,迫切需要由多模态大语言模型 (MLLM) 推动的新模型来解决。本文提出一种树状镜头 (Tree-of-Lens, ToL) 代理,利用新颖的 ToL 对齐机制,以解决 ScreenPR 任务。基于输入点坐标和对应的 GUI 屏幕截图,我们的 ToL 代理构建了分层布局树。基于该树,our ToL 代理不仅理解指定区域的内容,还阐述了元素之间的布局和空间关系。这种布局信息对于准确解释屏幕上的信息至关重要,这不同于其他屏幕阅读工具。我们还在新提出的 ScreenPR 数据集上,对 ToL 代理与其他基线方法进行了全面评估,该数据集包含来自移动设备、网页和操作系统的 GUI。最后,我们在移动 GUI 导航任务上测试了 ToL 代理,展示了其在识别执行轨迹中错误操作方面的实用性。代码与数据:https://screen-point-and-read.github.io
引用
@article{arxiv.2406.19263,
title = {Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding},
author = {Yue Fan and Lei Ding and Ching-Chen Kuo and Shan Jiang and Yang Zhao and Xinze Guan and Jie Yang and Yi Zhang and Xin Eric Wang},
journal= {arXiv preprint arXiv:2406.19263},
year = {2024}
}