关于隐狄利克雷分配模型训练的隐私保护
机器学习
2019-07-02 v2 人工智能
机器学习
摘要
隐狄利克雷分配(LDA)是一种流行的主题建模技术,用于发现文本数据集的隐藏语义结构,并在许多机器学习应用中发挥基础作用。然而,如同许多其他机器学习算法,训练LDA模型的过程可能泄露训练数据集的敏感信息并带来显著隐私风险。为缓解LDA中的隐私问题,本文重点研究LDA模型训练的隐私保护算法。具体而言,我们首先开发一种隐私监测算法,以探究集中式精选数据集上典型LDA训练算法中折叠吉布斯采样(CGS)过程固有随机性所提供的隐私保障。进而,我们进一步提出一种基于众包数据的本地私有LDA训练算法,为个体数据贡献者提供本地差分隐私。在真实世界数据集上的实验结果证明了我们所提算法的有效性。
引用
@article{arxiv.1906.01178,
title = {On Privacy Protection of Latent Dirichlet Allocation Model Training},
author = {Fangyuan Zhao and Xuebin Ren and Shusen Yang and Xinyu Yang},
journal= {arXiv preprint arXiv:1906.01178},
year = {2019}
}
备注
8 pages,5 figures,and is published in International Joint Conferences on Artificial Intelligence