激励联邦化:私有去中心化训练中基于梯度的数据选择与估值度量
机器学习
2024-04-17 v3 人工智能
密码学与安全
摘要
由于 A) 监管担忧以及 B) 缺乏数据所有者参与的激励,获取高质量数据以协作训练机器学习模型可能是一项具有挑战性的任务。第一个问题可通过分布式机器学习技术(例如联邦学习)与隐私增强技术(PET)(如差分隐私(DP)模型训练)相结合来解决。第二个挑战可通过奖励参与者提供对训练模型有益的数据访问权限来应对,这在数据分布不均的联邦环境中尤为重要。然而,DP 噪声会对代表性不足和 atypical(但往往信息丰富)的数据样本产生不利影响,使其有用性难以评估。在这项工作中,我们研究如何利用梯度信息,使私有训练环境中的参与者能够选择对联合训练模型最有益的数据。我们评估了两种此类方法,即梯度方差(VoG)和隐私损失-输入敏感性分数(PLIS)。我们表明,即使在更严格的隐私设置下,这些技术也能为联邦客户端提供原则性的数据选择工具。
引用
@article{arxiv.2305.02942,
title = {Incentivising the federation: gradient-based metrics for data selection and valuation in private decentralised training},
author = {Dmitrii Usynin and Daniel Rueckert and Georgios Kaissis},
journal= {arXiv preprint arXiv:2305.02942},
year = {2024}
}
备注
Accepted at EICC 2024