MobileA3gent:利用来自不同用户的去中心化自采数据训练移动 GUI 智能体
人工智能
2025-05-21 v2
摘要
移动 GUI 智能体的进步为移动设备上的任务自动化开辟了新的机遇。训练这些智能体需要大规模高质量数据,而依赖人工劳动获取这些数据的成本极其高昂。鉴于全球移动电话用户数量庞大,如果能够从他们那里自动收集数据,那么由此产生的数据量以及随后训练的移动智能体将达到前所未有的水平。然而,存在两大挑战:(1) 在无需人工干预的情况下提取用户指令,以及 (2) 在保护隐私的同时利用分布式用户数据。为应对这些挑战,我们提出了 MobileA3gent,这是一个协作框架,利用来自多样化用户的去中心化自源数据来训练移动 GUI 智能体。该框架包含两个组件,每个组件针对一个特定挑战:(1) Auto-Annotation,它能够在用户日常手机使用过程中以最低成本自动收集高质量数据集。(2) FedVLM-A,它通过结合基于 episode 级别和 step 级别变异性的自适应全局聚合,增强了非独立同分布(non-IID)下的联邦 VLM 训练。大量实验证明,MobileA3gent 仅以传统方法 1% 的成本就实现了卓越的性能,凸显了其在实际应用中的潜力。
引用
@article{arxiv.2502.02982,
title = {MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users},
author = {Wenhao Wang and Mengying Yuan and Zijie Yu and Guangyi Liu and Rui Ye and Tian Jin and Siheng Chen and Yanfeng Wang},
journal= {arXiv preprint arXiv:2502.02982},
year = {2025}
}