V-Zen:一种新颖的多模态大语言模型实现高效GUI理解与精确定位
人工智能
2024-07-23 v2 计算机视觉与模式识别
摘要
在人工智能研究和应用快速发展的格局中,多模态大语言模型(MLLM)已成为一股变革力量,擅长解释和整合来自文本、图像和图形用户界面(GUI)等多种模态的信息。尽管取得了这些进展,GUI的细微交互和理解仍然构成重大挑战,限制了现有模型提升自动化水平的潜力。为了弥合这一差距,本文提出了V-Zen,一种创新的多模态大语言模型(MLLM),经过精心设计以革新GUI理解和定位领域。配备双分辨率图像编码器,V-Zen在高效定位和下一步动作预测方面建立了新的基准,从而为自操作计算机系统奠定了基础。与V-Zen相辅相成的是GUIDE数据集,这是一个包含大量真实世界GUI元素和基于任务序列的广泛集合,作为专门微调的催化剂。V-Zen和GUIDE的成功集成标志着多模态AI研究新时代的到来,为智能、自主的计算体验打开了大门。本文邀请研究界加入这一激动人心的旅程,共同塑造GUI自动化的未来。本着开放科学的精神,我们的代码、数据和模型将公开发布,为具有复杂和精确交互的多模态对话场景铺平道路。
引用
@article{arxiv.2405.15341,
title = {V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM},
author = {Abdur Rahman and Rajat Chawla and Muskaan Kumar and Arkajit Datta and Adarsh Jha and Mukunda NS and Ishaan Bhola},
journal= {arXiv preprint arXiv:2405.15341},
year = {2024}
}
备注
12 pages, 5 figures, 3 tables