中文

训练视觉语言模型作为智能手机助手

机器学习 2024-04-16 v1 人工智能 计算机视觉与模式识别 人机交互

摘要

针对能够执行广泛用户任务的数字助手这一挑战,我们的研究聚焦于基于指令的移动设备控制领域。我们利用大型语言模型 (LLM) 的最新进展,提出了一种能够在移动设备上完成多样化任务的视觉语言模型 (VLM)。我们的模型仅通过与用户界面 (UI) 交互来运作。它使用来自设备屏幕的视觉输入,并模仿类似人类的交互,包括点击和滑动等手势。这种输入和输出空间的通用性使得我们的智能体能够与设备上的任何应用程序交互。与以往方法不同,我们的模型不仅基于单张屏幕图像,还基于由过去屏幕截图序列及相应动作创建的视觉语言句子。在具有挑战性的 Android in the Wild 基准测试上评估我们的方法,证明了其有前景的有效性和潜力。

关键词

引用

@article{arxiv.2404.08755,
  title  = {Training a Vision Language Model as Smartphone Assistant},
  author = {Nicolai Dorka and Janusz Marecki and Ammar Anwar},
  journal= {arXiv preprint arXiv:2404.08755},
  year   = {2024}
}

备注

ICLR 2024 workshop on Generative Models for Decision Making