SparkUI-Parser:通过鲁棒的定位与解析增强 GUI 感知
人工智能
2025-09-08 v1 计算与语言
计算机视觉与模式识别
人机交互
摘要
现有的用于 GUI 感知的多模态大语言模型 (MLLM) 已取得巨大进展。然而,先前的方法仍存在以下挑战:1) 它们基于文本自回归机制对离散坐标进行建模,导致定位精度较低且推理速度较慢。2) 它们只能定位预定义的元素集,无法解析整个界面,这阻碍了广泛的应用和对下游任务的支持。为解决上述问题,我们提出了 SparkUI-Parser,一个新颖的端到端框架,可同时实现更高的定位精度和对整个界面的细粒度解析能力。具体而言,我们并非使用基于概率的离散建模,而是基于预训练的多模态大语言模型 (MLLM),通过一个额外的 token 路由器和坐标解码器对坐标进行连续建模。这有效缓解了 MLLM 离散输出特性和逐 token 生成过程所固有的局限性,从而同时提升了精度和推理速度。为进一步增强鲁棒性,我们引入了一种基于改进的匈牙利匹配算法的拒绝机制,使模型能够识别并拒绝不存在的元素,从而减少误报。此外,我们提出了 ScreenParse,一个严格构建的基准,用于系统评估 GUI 模型在不同场景下的结构感知能力。大量实验表明,我们的方法在 ScreenSpot、ScreenSpot-v2、CAGUI-Grounding 和 ScreenParse 基准上一致优于 SOTA 方法。相关资源可在 https://github.com/antgroup/SparkUI-Parser 获取。
引用
@article{arxiv.2509.04908,
title = {SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing},
author = {Hongyi Jing and Jiafu Chen and Chen Rao and Ziqiang Dang and Jiajie Teng and Tianyi Chu and Juncheng Mo and Shuo Fang and Huaizhong Lin and Rui Lv and Chenguang Ma and Lei Zhao},
journal= {arXiv preprint arXiv:2509.04908},
year = {2025}
}