DP-MLM:基于掩码语言模型的差分隐私文本重写
计算与语言
2024-07-02 v1
摘要
文本隐私化使用差分隐私最近采取文本重写形式,其中通过生成(大型)语言模型对输入文本进行隐写。尽管这些方法在保护隐私方面显示出良好的潜力,但它们依赖自回归模型,这些模型缺乏对私人重写过程的上下文化机制。为此,我们提出了DP-MLM,一种基于掩码语言模型(MLMs)的差分隐私文本重写方法,用于以语义相似且隐写的方式重写文本。我们通过一种简单的上下文化技术实现了这一点,即逐token重写文本。我们发现,利用仅编码器的MLMs在较低的ε水平下可实现更好的效用保持,相对于依赖更大解码器模型的方法表现更好。此外,MLMs允许对重写机制进行更大的定制,与生成方法相比。我们将DP-MLM的代码公开于https://github.com/sjmeis/DPMLM。
引用
@article{arxiv.2407.00637,
title = {DP-MLM: Differentially Private Text Rewriting Using Masked Language Models},
author = {Stephen Meisenbacher and Maulik Chevli and Juraj Vladika and Florian Matthes},
journal= {arXiv preprint arXiv:2407.00637},
year = {2024}
}
备注
15 pages, 2 figures, 8 tables. Accepted to ACL 2024 (Findings)