1-Diffractor:基于词级度量差分隐私的高效且保持实用性的文本遮蔽方法
计算与语言
2024-05-06 v1
摘要
近年来,隐私保护的自然语言处理 (NLP) 研究受到广泛关注。其中一种有前景的研究方向是将差分隐私集成到 NLP 中,已在各种应用场景中带来创新方法。值得注意的是, 机制,通过对单词进行来隐去potentially敏感的输入文本。尽管这些方法在实证测试中显示出前景,但存在两个主要缺点:(1) 由于添加噪声,不可避免地导致实用性损失,(2) 在高维词嵌入上运行这些机制计算代价高昂。本文提出了,一种相较于先前方法具有显著加速优势的新机制,同时仍具备强大的实用性和隐私保护能力。我们评估了在多个 NLP 任务上的实用性、理论和任务隐私,以及速度和内存效率。在效率上实现了显著提升,同时在所有与先前 MLDP 机制的对比测试中保持了具竞争力的实用性和隐私得分。我们的代码已公开:https://github.com/sjmeis/Diffractor。
引用
@article{arxiv.2405.01678,
title = {1-Diffractor: Efficient and Utility-Preserving Text Obfuscation Leveraging Word-Level Metric Differential Privacy},
author = {Stephen Meisenbacher and Maulik Chevli and Florian Matthes},
journal= {arXiv preprint arXiv:2405.01678},
year = {2024}
}
备注
12 pages, 7 figures, 7 tables, 10th ACM International Workshop on Security and Privacy Analytics (IWSPA 2024)