联邦学习数据估值的原理性方法
机器学习
2020-09-15 v1 计算机与社会
机器学习
摘要
联邦学习(FL)是一种在去中心化数据源上训练机器学习(ML)模型的流行技术。为维持数据所有者长期参与,公平评估各数据源并补偿其对训练过程的贡献十分重要。Shapley 值(SV)定义了满足数据价值概念诸多诉求的唯一收益方案,已日益用于集中式学习中训练数据的估值。然而,计算 SV 需穷举评估模型在每个数据源子集上的性能,在联邦设定下带来 prohibitive 的通信开销。此外,标准 SV 忽略训练期间数据源的顺序,与 FL 的序贯本质冲突。本文提出一种适用于 FL 的 SV 变体,称为联邦 Shapley 值。联邦 SV 保留标准 SV 的可取性质,同时无需额外通信开销即可计算,并能捕捉参与顺序对数据价值的影响。我们在系列任务(包括不同基准数据集上的噪声标签检测、对抗参与者检测与数据摘要)上对联邦 SV 开展详尽实证研究,证明其能反映 FL 中数据源的真实效用,并有望增强系统鲁棒性、安全性与效率。我们也报告并分析了“失败案例”,以期激发未来研究。
引用
@article{arxiv.2009.06192,
title = {A Principled Approach to Data Valuation for Federated Learning},
author = {Tianhao Wang and Johannes Rausch and Ce Zhang and Ruoxi Jia and Dawn Song},
journal= {arXiv preprint arXiv:2009.06192},
year = {2020}
}