中文

AppVLM:用于在线应用控制的轻量级视觉语言模型

人工智能 2025-02-11 v1

摘要

将基础模型作为智能手机助手(称为应用代理)的利用是关键的研究挑战。这些代理旨在通过解释文本指令并通过设备界面执行动作来执行人的指令。尽管有前景,但当前方法面临严重限制。使用大型专有模型(如GPT-4o)的方法计算成本高昂,而使用较小微调模型的方法往往缺乏对超出分布任务的适应性。在本工作中,我们引入AppVLM,一种轻量级视觉语言模型(VLM)。首先,我们在AndroidControl数据集上对其进行离线微调。随后,我们通过收集来自AndroidWorld环境的数据并进行进一步的训练来细化其策略。我们的结果表明,AppVLM在AndroidControl数据集上的离线评估中实现了最高的动作预测准确率,与GPT-4o在AndroidWorld环境中的在线任务完成成功率相当,同时快了最高可达十倍。这使得AppVLM成为实际且高效的解决方案,可用于实际部署。

关键词

引用

@article{arxiv.2502.06395,
  title  = {AppVLM: A Lightweight Vision Language Model for Online App Control},
  author = {Georgios Papoudakis and Thomas Coste and Zhihao Wu and Jianye Hao and Jun Wang and Kun Shao},
  journal= {arXiv preprint arXiv:2502.06395},
  year   = {2025}
}