学习差分隐私循环语言模型
机器学习
2018-02-27 v3
摘要
我们证明,训练具有用户级差分隐私保证的大型循环语言模型是可行的,且仅需在预测精度上付出可忽略的代价。我们的工作建立在近期关于在用户分区数据上训练深度网络以及随机梯度下降隐私核算的进展之上。特别是,我们将用户级隐私保护添加到联邦平均算法中,该算法利用用户级数据进行“大步长”更新。我们的工作表明,给定一个具有足够多用户的数据集(即使是小型互联网规模的数据集也能轻松满足这一要求),实现差分隐私的代价在于增加计算量,而非像大多数先前工作那样导致效用下降。我们发现,当在大型数据集上训练时,我们的私有 LSTM 语言模型在定量和定性上都与无噪声模型相似。
引用
@article{arxiv.1710.06963,
title = {Learning Differentially Private Recurrent Language Models},
author = {H. Brendan McMahan and Daniel Ramage and Kunal Talwar and Li Zhang},
journal= {arXiv preprint arXiv:1710.06963},
year = {2018}
}
备注
Camera-ready ICLR 2018 version, minor edits from previous