基于校准多元扰动的隐私与效用兼顾文本分析
机器学习
2019-10-22 v1 计算与语言
密码学与安全
机器学习
摘要
在提供可量化隐私保障的同时准确从用户数据中学习,为构建更好的 ML 模型同时保持用户信任提供了契机。本文提出一种形式化方法,利用为位置数据实现地理不可区分性而设计的 dx-隐私概念进行隐私保护文本扰动。我们的方法按词嵌入模型所定义的高维空间中词的向量表示施加精心校准的噪声。我们给出了满足 dx-隐私的隐私证明,其中隐私参数 epsilon 针对词嵌入空间所定义的距离度量提供保障。我们通过分析基于 GloVe 与 fastText 嵌入大规模分析的可否认性统计来展示如何选取 epsilon。我们对 2 个基线模型进行隐私审计实验,并在 3 个数据集上进行效用实验,以展示不同任务类型下不同 epsilon 值时隐私与效用的权衡。我们的结果表明,在提供优于基线模型的隐私保障的同时,具有实用效用(训练二分类器效用损失 < 2%)。
引用
@article{arxiv.1910.08902,
title = {Privacy- and Utility-Preserving Textual Analysis via Calibrated Multivariate Perturbations},
author = {Oluwaseyi Feyisetan and Borja Balle and Thomas Drake and Tom Diethe},
journal= {arXiv preprint arXiv:1910.08902},
year = {2019}
}
备注
Accepted at WSDM 2020