中文

关于隐狄利克雷分配模型训练的隐私保护

机器学习 2019-07-02 v2 人工智能 机器学习

摘要

隐狄利克雷分配(LDA)是一种流行的主题建模技术,用于发现文本数据集的隐藏语义结构,并在许多机器学习应用中发挥基础作用。然而,如同许多其他机器学习算法,训练LDA模型的过程可能泄露训练数据集的敏感信息并带来显著隐私风险。为缓解LDA中的隐私问题,本文重点研究LDA模型训练的隐私保护算法。具体而言,我们首先开发一种隐私监测算法,以探究集中式精选数据集上典型LDA训练算法中折叠吉布斯采样(CGS)过程固有随机性所提供的隐私保障。进而,我们进一步提出一种基于众包数据的本地私有LDA训练算法,为个体数据贡献者提供本地差分隐私。在真实世界数据集上的实验结果证明了我们所提算法的有效性。

关键词

引用

@article{arxiv.1906.01178,
  title  = {On Privacy Protection of Latent Dirichlet Allocation Model Training},
  author = {Fangyuan Zhao and Xuebin Ren and Shusen Yang and Xinyu Yang},
  journal= {arXiv preprint arXiv:1906.01178},
  year   = {2019}
}

备注

8 pages,5 figures,and is published in International Joint Conferences on Artificial Intelligence