中文

词级差分隐私的局限

密码学与安全 2022-05-05 v1 计算与语言 机器学习

摘要

随着研究界对隐私与信任问题的日益关注,已有多种尝试用于匿名化文本数据。其中相当一部分方法引入差分隐私机制来扰动词嵌入,从而替换句子中的单个词。尽管这些方法是非常重要的贡献,相较于其他技术具有若干优势并确实展现出匿名化能力,但它们仍存在若干缺陷。本文研究这些弱点,并揭示出显著的数学约束会削弱理论隐私保证,以及在抵御去匿名化攻击、保留原句内容以及语言输出质量方面存在重大实际缺陷。最后,我们提出一种基于Transformer语言模型、经微调用于复述的新文本匿名化方法,该方法规避了大多数已识别的弱点,并提供形式化的隐私保证。我们通过充分的实验评估了方法的性能,并展示出相对于所讨论机制的更优表现。

关键词

引用

@article{arxiv.2205.02130,
  title  = {The Limits of Word Level Differential Privacy},
  author = {Justus Mattern and Benjamin Weggenmann and Florian Kerschbaum},
  journal= {arXiv preprint arXiv:2205.02130},
  year   = {2022}
}