中文

AppCopilot:通用、精准、长时程且高效的移动智能体

人工智能 2025-10-20 v2 计算与语言 计算机视觉与模式识别 人机交互

摘要

随着大语言模型和多模态模型的演进,移动智能体领域呈现出多样化而未收敛的格局。本文识别了移动智能体实现实际可扩展影响应解决的四个核心问题:(1) 跨任务、应用程序和设备的通用性;(2) 精度,具体指屏幕上精确交互和点击定位;(3) 长时程能力,以实现持续的多步骤目标;(4) 效率,即在资源受限设备上的高性能运行。我们提出了AppCopilot,一个跨应用程序运行的多模态、多智能体、通用移动智能体。AppCopilot通过从数据收集、训练、微调到高效推理和PC/移动端应用程序的端到端管线实现了这一愿景。在模型层面,它集成了支持中英文的多模态基础模型。在推理与控制层面,它结合链式思考推理、层次任务规划与分解、以及多智能体协作。在执行层面,它实现了经验性适应、语音交互、功能调用、跨应用程序和跨设备编排,以及全面的移动应用程序支持。该系统设计融合了基于剖析的优化,实现了异构硬件上延迟和内存的优化。经验结果表明,AppCopilot在四个维度实现了显著提升:更强的通用性、更高的屏幕操作精度、更可靠的长时程任务完成,以及更快、更高效的运行。通过构建从数据收集到训练再到微调和高效推理的闭环体系,本文为通用移动智能体提供了具体路线图,并提供可操作的指导。

关键词

引用

@article{arxiv.2509.02444,
  title  = {AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent},
  author = {Jingru Fan and Yufan Dang and Jingyao Wu and Huatao Li and Runde Yang and Xiyuan Yang and Yuheng Wang and Chen Qian},
  journal= {arXiv preprint arXiv:2509.02444},
  year   = {2025}
}

备注

Project at https://github.com/OpenBMB/AppCopilot