中文

TEM:文本上的高效用度量差分隐私

密码学与安全 2021-07-19 v1

摘要

确保用于训练自然语言处理(NLP)模型的用户数据隐私,对于建立和维护客户信任是必要的。差分隐私(DP)已成为保护个人隐私最成功的方法。然而,将 DP 应用于 NLP 领域面临独特挑战。最成功的先前方法使用一种针对度量空间的 DP 推广,并通过在词嵌入的度量空间中向输入添加噪声来实现私有化。然而,这些方法假设使用某一特定距离度量,忽略输入周围空间的密度,并假设所用嵌入已在非敏感数据上训练。在本工作中,我们提出截断指数机制(TEM),一种通用方法,允许使用任意距离度量在可训练于敏感数据的嵌入上对词进行私有化。我们的方法利用指数机制将私有化步骤转化为一个\emph{选择问题}。这使得应用于输入的噪声能根据输入周围嵌入空间的密度进行校准,并使嵌入的域适应成为可能。在我们的实验中,我们证明在相同隐私水平下,我们的方法在效用方面显著优于最先进水平,同时在度量选择上提供更大灵活性。

关键词

引用

@article{arxiv.2107.07928,
  title  = {TEM: High Utility Metric Differential Privacy on Text},
  author = {Ricardo Silva Carvalho and Theodore Vasiloudis and Oluwaseyi Feyisetan},
  journal= {arXiv preprint arXiv:2107.07928},
  year   = {2021}
}