中文

N-gram贝叶斯差分隐私

密码学与安全 2021-02-01 v1 计算与语言

摘要

与k-匿名等隐私缓解技术相比,差分隐私因其在机器学习中的强隐私保证而广受欢迎。然而,将差分隐私应用于n-gram计数会因其庞大词表而显著降低派生语言模型的效用。我们提出了一种差分隐私机制,该机制在贝叶斯设定下使用公共数据作为先验,以提供更紧的隐私损失度量epsilon界,从而获得更好的隐私-效用权衡。它首先将计数变换到对数空间,将公共与私有数据的分布近似为高斯分布。随后评估后验分布并应用softmax以产生概率分布。在epsilon等于0.1时,与先前已知机制相比,该技术使KL散度降低多达85%。我们在n-gram语言建模任务中将我们的机制与k-匿名进行比较,表明其在大词表规模下提供有竞争力的性能,同时提供 superior 的隐私保护。

关键词

引用

@article{arxiv.2101.12736,
  title  = {N-grams Bayesian Differential Privacy},
  author = {Osman Ramadan and James Withers and Douglas Orr},
  journal= {arXiv preprint arXiv:2101.12736},
  year   = {2021}
}

备注

12 pages, 6 figures