一种基于正则化马哈拉诺比斯度量的差分隐私文本扰动方法
计算与语言
2020-10-26 v1 密码学与安全
机器学习
机器学习
摘要
平衡隐私—效用权衡是许多处理敏感客户数据的实际机器学习系统的关键需求。一种流行的隐私保护文本分析方法是噪声注入:将文本数据先映射至连续嵌入空间,从适当分布中采样球形噪声进行扰动,再投影回离散词表空间。虽可使扰动满足所需的度量差分隐私,但基于该扰动数据建模的下游任务效用常较低,因为球形噪声未考虑嵌入空间中不同词周围密度的差异性。特别地,即便噪声尺度较大,稀疏区域中的词也可能保持不变。本文提出一种基于精心设计的马哈拉诺比斯度量正则化变体的文本扰动机制以克服该问题。对任意给定噪声尺度,该度量添加椭圆噪声以顾及嵌入空间中的协方差结构。沿不同方向的噪声尺度异质性有助于确保稀疏区域中的词具有充分替换可能,且不牺牲整体效用。我们给出基于该度量的文本扰动算法,并形式化证明其隐私保证。此外,经验表明,相较最先进的 Laplace 机制,我们的机制在达到同等效用水平时改善了隐私统计量。
引用
@article{arxiv.2010.11947,
title = {A Differentially Private Text Perturbation Method Using a Regularized Mahalanobis Metric},
author = {Zekun Xu and Abhinav Aggarwal and Oluwaseyi Feyisetan and Nathanael Teissier},
journal= {arXiv preprint arXiv:2010.11947},
year = {2020}
}
备注
11 pages, 7 figures