SynTF:用于隐私保护文本挖掘的合成与差分隐私词频向量
密码学与安全
2018-05-03 v1 信息检索
摘要
文本挖掘与信息检索技术已被开发出来,以协助我们借助计算机分析、组织和检索文档。在许多情况下,希望此类文档的作者保持匿名:搜索日志可能会揭示用户的敏感细节,有关公司或政府的批评性文章或消息可能会给批评者带来严重甚至致命的后果,而客户调查中的负面反馈一旦被识别,可能会对商业关系产生负面影响。然而,简单地从文档中删除个人身份信息不足以保护作者身份:给定嫌疑人作者的一些参考文本,所谓的作者归属方法可以从文本本身重新识别作者。在许多常见的文本挖掘和信息检索任务中,表示文档的最突出模型之一是向量空间模型,其中每个文档表示为一个向量,通常包含其词频或相关量。因此,我们提出了一种自动化文本匿名化方法,为输入文档生成可用于替代原始向量的合成词频向量。我们在示例性文本分类任务上评估了我们的方法,并证明它对准确率的影响很小。相比之下,我们表明我们的方法对作者归属技术产生了强烈影响,使其准确率大幅下降而变得不可行。与以往的作者混淆方法不同,我们的方法是首个满足差分隐私的方法,因此带有可证明的合理否认保证。
引用
@article{arxiv.1805.00904,
title = {SynTF: Synthetic and Differentially Private Term Frequency Vectors for Privacy-Preserving Text Mining},
author = {Benjamin Weggenmann and Florian Kerschbaum},
journal= {arXiv preprint arXiv:1805.00904},
year = {2018}
}
备注
This report is an extended version of our SIGIR'18 paper