Mobile-Agent-V:一种面向移动自动化中高效且便捷操作知识注入的视频引导方法
计算与语言
2025-06-04 v3 计算机视觉与模式识别
摘要
移动设备使用量的指数级增长需要简化的自动化以实现有效的任务管理,然而许多 AI 框架因缺乏操作专业知识而表现不佳。虽然手动编写的知识可以弥合这一差距,但这往往既繁琐又低效。我们引入了 Mobile-Agent-V,这是一种创新框架,利用视频作为引导工具,将操作知识便捷且高效地注入到移动自动化流程中。通过直接从视频内容中提取知识,Mobile-Agent-V 消除了人工干预,显著减少了知识获取所需的工作量和时间。为了严格评估该方法,我们提出了 Mobile-Knowledge,这是一个专门用于评估外部知识对移动智能体性能影响的基准。我们的实验结果表明,与现有方法相比,Mobile-Agent-V 将性能提升了 36%,凸显了其在移动自动化中便捷且高效的优势。
引用
@article{arxiv.2502.17110,
title = {Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation},
author = {Junyang Wang and Haiyang Xu and Xi Zhang and Ming Yan and Ji Zhang and Fei Huang and Jitao Sang},
journal= {arXiv preprint arXiv:2502.17110},
year = {2025}
}
备注
17 pages, 7 figures, 9 tables