中文

基于自然语言净化的文本分析差分隐私方法

计算与语言 2021-06-03 v1 密码学与安全

摘要

文本传递精深的知识,但也传递敏感信息。尽管通用语言模型与具有差分隐私(DP)的专用机制已取得成效,现有文本净化机制仍因高维文本表示的制约而效用低下。利用净化文本进行下游分析这一伴随问题也少有探究。本文采取一种直接的文本净化方法。我们的洞见是通过新的局部 DP 概念同时考量敏感度与相似性。净化后的文本亦有助于我们的净化感知预训练与微调,从而基于 BERT 语言模型实现具有良好效用的隐私保护自然语言处理。令人惊讶的是,高效用并未提升推理攻击的成功率。

关键词

引用

@article{arxiv.2106.01221,
  title  = {Differential Privacy for Text Analytics via Natural Text Sanitization},
  author = {Xiang Yue and Minxin Du and Tianhao Wang and Yaliang Li and Huan Sun and Sherman S. M. Chow},
  journal= {arXiv preprint arXiv:2106.01221},
  year   = {2021}
}

备注

ACL-ICJNLP'21 Findings; The first two authors contributed equally