MobileFlow:面向移動 GUI 代理的多模態大型語言模型
计算机视觉与模式识别
2024-12-09 v3
摘要
目前,移動式圖形使用者介面 (GUI) 的整合在大多數人日常生活中都非常普及。而正在進行的多模態大型模型發展,如 GPT-4v、Qwen-VL-Max,顯著提升了 GUI 理解和用戶行動分析的能力,展現了智能 GUI 助理的潛力。然而,當前的 GUI 代理往往需要透過調用系統 API 來取得頁面布局資訊,可能帶來隱私風險。將 GUI(如移動介面)固定到某個低解析度會導致細粒度圖像細節的喪失。同時,現有為 GUI 代理構建的多模態大模型在理解和決策中文 GUI 介面方面表現不佳,難以應用於大量中文應用程式。本文介紹 MobileFlow,專為移動 GUI 代理精心構建的多模態大型語言模型。將開源模型 Qwen-VL-Chat 轉化為 GUI 領域的 MobileFlow 包含約 210 億參數,並配備新型混合視覺編碼器,使得圖像輸入的可變解析度成為可能,並能良好支援多語言 GUI。通過融入混合專家 (MoE) 擴展和創新對齊訓練策略,MobileFlow 具備充分解讀圖像資料並理解用戶指令以完成 GUI 互動任務的能力。最後,MobileFlow 在兩種公共評估指標以及我們提出的評估指標下,都勝於 Qwen-VL-Max 和 GPT-4v,並已成功部署於實際商業情境中,證明其對實務應用具有有效性。
引用
@article{arxiv.2407.04346,
title = {MobileFlow: A Multimodal LLM For Mobile GUI Agent},
author = {Songqin Nong and Jiali Zhu and Rui Wu and Jiongchao Jin and Shuo Shan and Xiutian Huang and Wenhao Xu},
journal= {arXiv preprint arXiv:2407.04346},
year = {2024}
}