dpUGC:面向用户生成内容学习差分隐私表示
计算与语言
2019-03-26 v1 密码学与安全
摘要
本文首次提出一种简单而高效的通用方法,将差分隐私应用于文本表示(即词嵌入)。基于此,我们提出一种用户级方法,在用户生成内容(UGC)上学习个性化的差分隐私词嵌入模型。据我们所知,这是首个从文本中学习用于共享的用户级差分隐私词嵌入模型的工作。所提方法保护了个体免于再识别的隐私,尤其在用于共享的UGC数据上提供了更好的隐私与数据效用权衡。实验结果表明,训练得到的嵌入模型适用于经典文本分析任务(如回归)。此外,所提学习差分隐私嵌入模型的方法均与框架和数据无关,便于部署与共享。源代码见https://github.com/sonvx/dpText。
引用
@article{arxiv.1903.10453,
title = {dpUGC: Learn Differentially Private Representation for User Generated Contents},
author = {Xuan-Son Vu and Son N. Tran and Lili Jiang},
journal= {arXiv preprint arXiv:1903.10453},
year = {2019}
}