中文

联邦学习中高效数据估值近似:基于抽样的方法

机器学习 2025-04-24 v1 数据库

摘要

联邦学习范式利用来自多个数据提供者的数据。在 FL 中,跨数据塔的数据提供者往往犹豫是否分享其高质量数据集,除非能够公正评估其数据价值。Shapley 值(SV)因其理想属性而被推崇为 FL 中数据估值的标准指标。然而,SV 的计算开销在实际中不可接受,因为其本质要求在指数级的数据组合上进行训练和评估 FL 模型。此外,现有解决方案在实现精度和效率方面均不理想,使 SV 在实际中的应用仍遥不可及,因为它们忽略了为近似框架选择合适计算方案的需求,并忽视了 FL 中实用函数的特性。我们首先提出一种统一的分层抽样框架,用于两种广泛使用的方法。随后,我们在 FL 线性回归假设下分析并选择更具前景的方案。随后,我们识别出一种称为关键组合的现象,即仅限于少数数据组合对最终数据估值具有高影响。基于这些见解,我们提出一种实用近似算法 IPSS,通过战略性地选择高影响的数据组合而非评估所有可能的组合,从而在保持较小近似误差的同时大幅降低计算时间。此外,我们在联邦学习基准数据集上进行了广泛评估,以证明所提算法在效率和有效性方面优于一系列代表性基线方法。

关键词

引用

@article{arxiv.2504.16668,
  title  = {Efficient Data Valuation Approximation in Federated Learning: A Sampling-based Approach},
  author = {Shuyue Wei and Yongxin Tong and Zimu Zhou and Tianran He and Yi Xu},
  journal= {arXiv preprint arXiv:2504.16668},
  year   = {2025}
}