当差分隐私遇上自然语言处理:细节之中见魔鬼
计算与语言
2022-03-07 v1 密码学与安全
摘要
差分隐私为个体隐私提供了一种形式化方法。差分隐私在各种场景中的应用,例如保护用户的原始话语,必须满足特定的数学性质。我们的贡献是对 ADePT(Krishna 等人,2021 提出的一种用于文本重写的差分隐私自编码器)的形式化分析。ADePT 在提供严格隐私保证的同时,在下游任务上取得了有前景的结果。我们的证明揭示 ADePT 并非差分隐私的,从而使得实验结果缺乏依据。我们还量化了其私有机制中误差的影响,表明在编码器维度极小的乐观情况下,真实敏感度至少高出 6 倍,且未被私有化的话语数量很容易达到整个数据集的 100%。我们的意图既非批评作者,也非批评同行评审过程,而是指出:若自然语言处理中的差分隐私应用依赖于形式化保证,则这些保证应被完整列出并置于细致审查之下。
引用
@article{arxiv.2109.03175,
title = {When differential privacy meets NLP: The devil is in the detail},
author = {Ivan Habernal},
journal= {arXiv preprint arXiv:2109.03175},
year = {2022}
}
备注
Camera-ready for EMNLP 2021