Mobile-Agent-v2:通过多智能体协作实现有效导航的移动设备操作助手
计算与语言
2024-06-04 v1 计算机视觉与模式识别
摘要
移动设备操作任务正日益成为流行的多模态AI应用场景。当前的多模态大语言模型(MLLMs)受限于其训练数据,缺乏作为操作助手的有效能力。相反,基于MLLM的智能体通过工具调用来增强能力,正逐渐被应用于此场景。然而,移动设备操作任务中的两大导航挑战——任务进度导航和焦点内容导航——在现有工作的单智能体架构下变得显著复杂。这是由于过长的令牌序列和交错的文本-图像数据格式限制了性能。为了有效应对这些导航挑战,我们提出了Mobile-Agent-v2,一种用于移动设备操作辅助的多智能体架构。该架构包含三个智能体:规划智能体、决策智能体和反思智能体。规划智能体生成任务进度,使历史操作的导航更加高效。为了保留焦点内容,我们设计了一个随任务进度更新的记忆单元。此外,为了纠正错误操作,反思智能体观察每次操作的结果并相应处理错误。实验结果表明,与Mobile-Agent的单智能体架构相比,Mobile-Agent-v2在任务完成度上实现了超过30%的提升。代码已在https://github.com/X-PLUG/MobileAgent开源。
引用
@article{arxiv.2406.01014,
title = {Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration},
author = {Junyang Wang and Haiyang Xu and Haitao Jia and Xi Zhang and Ming Yan and Weizhou Shen and Ji Zhang and Fei Huang and Jitao Sang},
journal= {arXiv preprint arXiv:2406.01014},
year = {2024}
}
备注
22 pages, 11 figures, 10 Tables