中文

Mobile-Agent-v2:通过多智能体协作实现有效导航的移动设备操作助手

计算与语言 2024-06-04 v1 计算机视觉与模式识别

摘要

移动设备操作任务正日益成为流行的多模态AI应用场景。当前的多模态大语言模型(MLLMs)受限于其训练数据,缺乏作为操作助手的有效能力。相反,基于MLLM的智能体通过工具调用来增强能力,正逐渐被应用于此场景。然而,移动设备操作任务中的两大导航挑战——任务进度导航和焦点内容导航——在现有工作的单智能体架构下变得显著复杂。这是由于过长的令牌序列和交错的文本-图像数据格式限制了性能。为了有效应对这些导航挑战,我们提出了Mobile-Agent-v2,一种用于移动设备操作辅助的多智能体架构。该架构包含三个智能体:规划智能体、决策智能体和反思智能体。规划智能体生成任务进度,使历史操作的导航更加高效。为了保留焦点内容,我们设计了一个随任务进度更新的记忆单元。此外,为了纠正错误操作,反思智能体观察每次操作的结果并相应处理错误。实验结果表明,与Mobile-Agent的单智能体架构相比,Mobile-Agent-v2在任务完成度上实现了超过30%的提升。代码已在https://github.com/X-PLUG/MobileAgent开源。

关键词

引用

@article{arxiv.2406.01014,
  title  = {Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration},
  author = {Junyang Wang and Haiyang Xu and Haitao Jia and Xi Zhang and Ming Yan and Weizhou Shen and Ji Zhang and Fei Huang and Jitao Sang},
  journal= {arXiv preprint arXiv:2406.01014},
  year   = {2024}
}

备注

22 pages, 11 figures, 10 Tables