MobileVLM:用于更好理解单元内外的视觉语言模型
计算与语言
2024-10-04 v2 人工智能
摘要
最近,基于VLM的移动AI智能体正获得越来越多的关注。这些作品通常以VLM为基础,利用基于指令的移动数据集进行微调。然而,这些VLM通常是在通用领域数据上预训练的,往往缺乏针对移动领域的基本能力,可能难以识别特定UI元素和理解单元内的细粒度信息。此外,当前的微调任务侧重于与给定指令最相关的元素进行交互。这些微调后的VLM可能仍忽略UI页面之间的关系,忽略元素在页面转换中的作用,缺乏单元间的理解。为此,我们提出了MobileVLM,包含两个额外的预训练阶段,以增强单元内和单元间的理解。我们定义了四个基于UI的预训练任务,使模型能够更好地感知细粒度元素并捕获页面转换动作。为了解决移动预训练数据匮乏的问题,我们从零开始构建了一个包含300万个UI页面和真实世界转换动作的大型中文移动数据集Mobile3M,形成有向图结构。实验结果表明,MobileVLM在我们的测试集和公共移动基准测试中都表现出色,对现有VLM而言,性能显著优于。
引用
@article{arxiv.2409.14818,
title = {MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding},
author = {Qinzhuo Wu and Weikai Xu and Wei Liu and Tao Tan and Jianfeng Liu and Ang Li and Jian Luan and Bin Wang and Shuo Shang},
journal= {arXiv preprint arXiv:2409.14818},
year = {2024}
}