中文

具有差分隐私的合成文本生成:一种简单实用的方案

计算与语言 2023-07-19 v3 密码学与安全

摘要

由于机器学习模型倾向于记忆敏感训练数据,隐私问题在数据驱动的产品中引起了越来越多的关注。生成此类数据的合成版本并提供形式化的隐私保证(如差分隐私(DP)),为缓解这些隐私问题提供了一条有前景的途径,但以往该方向的方法通常无法生成高质量的合成数据。在本研究中,我们展示了一种文本领域中简单且实用的有效方案:仅需对预训练的生成式语言模型进行带有 DP 的微调,即可使模型生成具有强隐私保护的有用的合成文本。通过对基准数据和私有客户数据的广泛实证分析,我们证明我们的方法在效用方面可与非隐私对应方法相媲美,同时针对潜在的隐私泄露提供了强有力的保护。

关键词

引用

@article{arxiv.2210.14348,
  title  = {Synthetic Text Generation with Differential Privacy: A Simple and Practical Recipe},
  author = {Xiang Yue and Huseyin A. Inan and Xuechen Li and Girish Kumar and Julia McAnallen and Hoda Shajari and Huan Sun and David Levitan and Robert Sim},
  journal= {arXiv preprint arXiv:2210.14348},
  year   = {2023}
}

备注

ACL 2023 Main Conference (Honorable Mention)