N-gram贝叶斯差分隐私
密码学与安全
2021-02-01 v1 计算与语言
摘要
与k-匿名等隐私缓解技术相比,差分隐私因其在机器学习中的强隐私保证而广受欢迎。然而,将差分隐私应用于n-gram计数会因其庞大词表而显著降低派生语言模型的效用。我们提出了一种差分隐私机制,该机制在贝叶斯设定下使用公共数据作为先验,以提供更紧的隐私损失度量epsilon界,从而获得更好的隐私-效用权衡。它首先将计数变换到对数空间,将公共与私有数据的分布近似为高斯分布。随后评估后验分布并应用softmax以产生概率分布。在epsilon等于0.1时,与先前已知机制相比,该技术使KL散度降低多达85%。我们在n-gram语言建模任务中将我们的机制与k-匿名进行比较,表明其在大词表规模下提供有竞争力的性能,同时提供 superior 的隐私保护。
引用
@article{arxiv.2101.12736,
title = {N-grams Bayesian Differential Privacy},
author = {Osman Ramadan and James Withers and Douglas Orr},
journal= {arXiv preprint arXiv:2101.12736},
year = {2021}
}
备注
12 pages, 6 figures