差分隐私 n-gram 抽取
机器学习
2021-08-09 v1 密码学与安全
数据结构与算法
摘要
我们重新审视差分隐私设置下的 -gram 抽取问题。在该问题中,给定私有文本数据语料库,目标是在保护用户级隐私的同时尽可能多地发布 -gram。抽取 -gram 是许多 NLP 应用(如句子补全、邮件回复生成等)中的基础子过程。该问题也出现在序列挖掘等其他应用中,并且是近期研究的差分隐私集并集(DPSU)的推广。在本文中,我们为该问题开发了一种新的差分隐私算法,在实验中显著优于当前最优方法。我们的改进源于结合 DPSU 的最新进展、隐私核算,以及针对 Chen et al. (2012) 提出的基于树的方法的新剪枝启发式。
引用
@article{arxiv.2108.02831,
title = {Differentially Private n-gram Extraction},
author = {Kunho Kim and Sivakanth Gopi and Janardhan Kulkarni and Sergey Yekhanin},
journal= {arXiv preprint arXiv:2108.02831},
year = {2021}
}