中文

ZonUI-3B:用于跨分辨率 GUI 基准的轻量级视觉语言模型

计算机视觉与模式识别 2025-07-21 v3 人工智能

摘要

本文提出 ZonUI-3B,一种轻量级视觉语言模型 (VLM),可在单块消费级 GPU (RTX 4090) 上完成完整训练,同时在 GUI 基准任务上性能媲美规模更大的模型。该模型包含若干关键创新点:(i) 综合跨平台、多分辨率数据集,包含 24K 个来自移动、桌面和网页 GUI 屏幕截图的示例,有效缓解高分辨率桌面环境中的数据稀缺问题;(ii) 两阶段微调策略,初始跨平台训练建立稳健的 GUI 理解能力,随后在高分辨率数据上进行专业微调以显著提升模型适应性;(iii) 数据精选和冗余降低策略,表明随机抽取规模较小的子集并降低冗余度即可实现与更大数据集相当的性能,强调数据多样性而非单纯数据量。经典的 GUI 基准测试,包括 ScreenSpot、ScreenSpot-v2 和具备挑战性的 ScreenSpot-Pro,的广泛评估显示,ZonUI-3B 在 ScreenSpot 上达到 84.9%,在 ScreenSpot-v2 上达到 86.4%,超越了参数 under 4B 的先前模型。消融研究验证了在提升鲁棒性方面,尤其是在高分辨率桌面场景中,平衡抽样和两阶段微调的关键作用。ZonUI-3B 可在:https://github.com/Han1018/ZonUI-3B 获取。

关键词

引用

@article{arxiv.2506.23491,
  title  = {ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding},
  author = {ZongHan Hsieh and Tzer-Jen Wei and ShengJing Yang},
  journal= {arXiv preprint arXiv:2506.23491},
  year   = {2025}
}