FedMABench: 面向去中心化异构用户数据的移动代理基准测试
人工智能
2025-03-10 v1 机器学习
摘要
移动代理近期吸引了大量研究关注。传统的移动代理训练方法依赖集中数据收集,导致成本高昂且规模受限。分布式训练利用联邦学习提供了一种替代方案,通过利用真实用户数据实现可扩展性并降低成本。然而,包括缺乏标准化基准测试在内的诸多关键挑战阻碍了该领域的进展。为解决这些问题,我们引入 FedMABench,这是第一个为联邦训练和评估移动代理提供的基准测试,专为异构场景设计。FedMABench 包含 6 个数据集,30+ 子集,8 个联邦算法,10+ 基础模型,以及覆盖 5 个类别的 800+ 个应用,为在多样化环境中评估移动代理提供了全面框架。通过大规模实验,我们发现联邦算法始终优于本地训练;特定应用的分布在异构性中起关键作用;并且即使来自不同类别的应用在训练期间也可能存在相关性。FedMABench 已公开于: https://github.com/wwh0411/FedMABench,数据集可在: https://huggingface.co/datasets/wwh0411/FedMABench 获取。
引用
@article{arxiv.2503.05143,
title = {FedMABench: Benchmarking Mobile Agents on Decentralized Heterogeneous User Data},
author = {Wenhao Wang and Zijie Yu and Rui Ye and Jianqing Zhang and Siheng Chen and Yanfeng Wang},
journal= {arXiv preprint arXiv:2503.05143},
year = {2025}
}