理解联邦学习中的非预期记忆
机器学习
2020-06-16 v1 计算与语言
机器学习
摘要
最近的研究表明,生成式序列模型(例如语言模型)有记忆训练数据中稀有或独特序列的倾向。由于有用的模型通常在敏感数据上进行训练,为了确保训练数据的隐私,识别并减轻这种非预期记忆至关重要。联邦学习(FL)已成为大规模分布式学习任务的一种新颖框架。然而,它在许多方面与所有数据都存储在中央服务器的、已被充分研究的集中式学习环境不同。在本文中,我们启动了一项形式化研究,以理解规范联邦学习的不同组件对训练模型中非预期记忆的影响,并与集中式学习环境进行比较。我们的结果表明,联邦学习的几个不同组件在减少非预期记忆方面起着重要作用。具体来说,我们观察到,根据用户进行的数据聚类——这在联邦学习中是通过设计实现的——对减少此类记忆有显著效果,并且使用联邦平均方法进行训练会进一步减少记忆。我们还表明,使用具有强用户级差分隐私保证进行训练,得到的模型表现出最少量的非预期记忆。
引用
@article{arxiv.2006.07490,
title = {Understanding Unintended Memorization in Federated Learning},
author = {Om Thakkar and Swaroop Ramaswamy and Rajiv Mathews and Françoise Beaufays},
journal= {arXiv preprint arXiv:2006.07490},
year = {2020}
}