具有差分隐私的隐狄利克雷分配模型训练
机器学习
2020-10-12 v1 密码学与安全
摘要
隐狄利克雷分配(LDA)是一种流行的主题建模技术,用于对文本数据的隐藏语义进行发现,并作为各类应用中文本分析的基础工具。然而,LDA 模型及其训练过程可能暴露训练数据中的文本信息,从而带来显著的隐私担忧。为解决 LDA 中的隐私问题,我们系统性地研究了基于折叠吉布斯采样(CGS)的主流 LDA 训练算法的隐私保护,并针对典型训练场景提出了若干差分私有 LDA 算法。具体而言,我们首次对基于 CGS 的 LDA 训练所固有的差分隐私保证进行了理论分析,并进一步提出一种集中式隐私保护算法(HDP-LDA),可防止从 CGS 训练的中间统计量推断数据。此外,我们提出一种针对众包数据的本地私有 LDA 训练算法(LP-LDA),为个体数据贡献者提供本地差分隐私。进而,我们将 LP-LDA 扩展为在线版本 OLP-LDA,以在流设置下基于本地私有小批量实现 LDA 训练。大量分析与实验结果验证了我们所提隐私保护 LDA 训练算法的有效性与高效性。
引用
@article{arxiv.2010.04391,
title = {Latent Dirichlet Allocation Model Training with Differential Privacy},
author = {Fangyuan Zhao and Xuebin Ren and Shusen Yang and Qing Han and Peng Zhao and Xinyu Yang},
journal= {arXiv preprint arXiv:2010.04391},
year = {2020}
}