中文

两个模型胜于一个:联邦学习对Google GBoard下一词预测并不隐私

机器学习 2023-10-11 v2

摘要

本文提出针对用于训练自然语言文本模型的联邦学习的新攻击。我们展示了这些攻击对Google GBoard应用中使用的下一词预测模型的有效性,GBoard是一款广泛使用的移动键盘应用,也是早期在生产中使用联邦学习的采用者。我们证明,用户在手机上输入的词(例如发送短信时)可在广泛条件下以高准确率被恢复,并且诸如使用小批量以及添加本地噪声等对策是无效的。我们还表明词序(以及所输入的实际句子)可以高保真度被重建。这引发了明显的隐私担忧,特别是因为GBoard已处于生产使用中。

关键词

引用

@article{arxiv.2210.16947,
  title  = {Two Models are Better than One: Federated Learning Is Not Private For Google GBoard Next Word Prediction},
  author = {Mohamed Suliman and Douglas Leith},
  journal= {arXiv preprint arXiv:2210.16947},
  year   = {2023}
}

备注

ESORICS 2023