中文

利用层次化表示在文本中兼顾隐私与效用

机器学习 2019-10-22 v1 计算与语言 密码学与安全 机器学习

摘要

在任意文本中保证一定程度的用户隐私是一个具有挑战性的问题。然而,这一挑战也带来了释放海量数据存储以训练机器学习模型并支持数据驱动决策的潜力。我们通过 dx-隐私(Differential Privacy 对非汉明距离度量的推广)的视角来解决该问题。在本文中,我们探索双曲空间中的词表示作为在文本中保护隐私的手段。我们给出了满足 dx-隐私的证明,继而定义双曲空间中的概率分布并描述一种在高维中从中采样的方法。隐私通过扰动词的高维双曲空间向量表示以获得语义泛化来提供。我们进行了一系列实验以展示隐私与效用之间的权衡。我们的隐私实验展示了对抗作者身份归属算法的保护,而效用实验则突出了我们的扰动对若干下游机器学习模型的最小影响。与欧氏基线相比,我们在可比较的最坏情况统计下观察到预期隐私保障提升超过 20 倍。

关键词

引用

@article{arxiv.1910.08917,
  title  = {Leveraging Hierarchical Representations for Preserving Privacy and Utility in Text},
  author = {Oluwaseyi Feyisetan and Tom Diethe and Thomas Drake},
  journal= {arXiv preprint arXiv:1910.08917},
  year   = {2019}
}

备注

Accepted at ICDM 2019