大规模差分隐私BERT
机器学习
2021-08-04 v1 计算与语言
密码学与安全
摘要
在这项工作中,我们研究了使用差分隐私SGD(DP-SGD)对BERT-Large进行大规模预训练。我们表明,结合仔细的实现,将批量大小扩大到数百万(即巨型批次)可提高BERT的DP-SGD步骤的效用;我们还通过使用递增的批量大小调度来提升其效率。我们的实现建立在[SVK20]近期工作的基础上,该工作证明了通过有效使用JAX [BFH+18, FJL18]原语与XLA编译器 [XLA17] 相结合,可以最小化DP-SGD步骤的开销。我们的实现在批量大小为2M、 的情况下,实现了60.5%的掩码语言模型准确率。作为对比,非隐私BERT模型实现了约70%的准确率。
引用
@article{arxiv.2108.01624,
title = {Large-Scale Differentially Private BERT},
author = {Rohan Anil and Badih Ghazi and Vineet Gupta and Ravi Kumar and Pasin Manurangsi},
journal= {arXiv preprint arXiv:2108.01624},
year = {2021}
}
备注
12 pages, 6 figures