中文

FedMABench: 面向去中心化异构用户数据的移动代理基准测试

人工智能 2025-03-10 v1 机器学习

摘要

移动代理近期吸引了大量研究关注。传统的移动代理训练方法依赖集中数据收集,导致成本高昂且规模受限。分布式训练利用联邦学习提供了一种替代方案,通过利用真实用户数据实现可扩展性并降低成本。然而,包括缺乏标准化基准测试在内的诸多关键挑战阻碍了该领域的进展。为解决这些问题,我们引入 FedMABench,这是第一个为联邦训练和评估移动代理提供的基准测试,专为异构场景设计。FedMABench 包含 6 个数据集,30+ 子集,8 个联邦算法,10+ 基础模型,以及覆盖 5 个类别的 800+ 个应用,为在多样化环境中评估移动代理提供了全面框架。通过大规模实验,我们发现联邦算法始终优于本地训练;特定应用的分布在异构性中起关键作用;并且即使来自不同类别的应用在训练期间也可能存在相关性。FedMABench 已公开于: https://github.com/wwh0411/FedMABench,数据集可在: https://huggingface.co/datasets/wwh0411/FedMABench 获取。

关键词

引用

@article{arxiv.2503.05143,
  title  = {FedMABench: Benchmarking Mobile Agents on Decentralized Heterogeneous User Data},
  author = {Wenhao Wang and Zijie Yu and Rui Ye and Jianqing Zhang and Siheng Chen and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2503.05143},
  year   = {2025}
}