中文

面向语言建模的选择性差分隐私

计算与语言 2022-07-19 v3 密码学与安全

摘要

随着语言模型应用的增多,保护这些模型免泄露隐私信息已变得至关重要。已有工作试图通过训练具差分隐私保证的基于 RNN 的语言模型来应对此挑战。然而,将经典差分隐私应用于语言模型会导致模型性能不佳,因其底层隐私概念过于悲观,且对数据中全部词元提供无差别保护。鉴于自然语言中的隐私信息稀疏(例如,邮件主体可能不携带个人身份信息),我们提出一种新隐私概念——选择性差分隐私,以对数据中敏感部分提供严格隐私保证,从而提升模型效用。为实现该新概念,我们开发了相应的隐私机制 Selective-DPSGD,用于基于 RNN 的语言模型。除语言建模外,我们还将该方法应用于更具体的应用——对话系统。在语言建模与对话系统构建上的实验表明,相较于基线,所提隐私保护机制在各种隐私攻击下保持安全的同时获得了更好效用。数据与代码发布于 https://github.com/wyshi/lm_privacy 以促进未来研究。

关键词

引用

@article{arxiv.2108.12944,
  title  = {Selective Differential Privacy for Language Modeling},
  author = {Weiyan Shi and Aiqi Cui and Evan Li and Ruoxi Jia and Zhou Yu},
  journal= {arXiv preprint arXiv:2108.12944},
  year   = {2022}
}

备注

NAACL 2022