基于短语的词级度量差分隐私方法
计算与语言
2024-07-02 v1
摘要
差分隐私在NLP中的应用必须区分所提议机制操作的语法层级,通常采取词级或文档级隐私化形式。最近提出了几种词级“度量”差分隐私方法,这些方法依赖于这种广义DP概念在词嵌入空间中的操作。然而,这些方法往往难以产生语义连贯的文本输出,其在句子或文档级的应用只能通过对词扰动的基本组合来实现。本文旨在通过在词和句子水平之间操作(即使用短语)来解决这些挑战。通过对n-gram进行扰动而非单个词,我们构建了一个方法,其中组合后的隐私化输出在语义连贯性和长度可变方面得到提高。这通过构建基于频繁occurring词组的嵌入模型来实现,其中单词与双词和三词短语共存。我们在效用和隐私测试中评估了该方法,明确证明了超越词级tokenization策略的必要性。
引用
@article{arxiv.2407.00638,
title = {A Collocation-based Method for Addressing Challenges in Word-level Metric Differential Privacy},
author = {Stephen Meisenbacher and Maulik Chevli and Florian Matthes},
journal= {arXiv preprint arXiv:2407.00638},
year = {2024}
}
备注
13 pages, 2 figures, 9 tables. Accepted to PrivateNLP 2024