本地差分隐私朴素贝叶斯分类
机器学习
2019-05-06 v1 密码学与安全
机器学习
摘要
在机器学习中,需要训练分类模型以预测类标签。当训练数据包含个人隐私信息时,出于隐私顾虑,收集训练数据变得困难。本地差分隐私是在没有可信数据管理者的情况下衡量个人隐私的一种定义。个人与不可信的数据聚合器交互,后者获取有关总体的统计信息而不学习个人数据。为了在不可信环境中训练朴素贝叶斯分类器,我们建议使用满足本地差分隐私的方法。个人发送其扰动后的输入,这些输入保留了特征值与类标签之间的关系。数据聚合器估计朴素贝叶斯分类器所需的所有概率。然后,可以基于估计的概率对新实例进行分类。我们针对离散和连续数据提出了相应的解决方案。为了消除多维数据中的大量噪声并降低通信成本,我们建议利用降维技术,个人可以在扰动其输入之前应用这些技术。我们的实验结果表明,即使在本地差分隐私下保证了个人隐私,朴素贝叶斯分类器的准确性仍得以维持,并且使用降维技术提高了准确性。
引用
@article{arxiv.1905.01039,
title = {Locally Differentially Private Naive Bayes Classification},
author = {Emre Yilmaz and Mohammad Al-Rubaie and J. Morris Chang},
journal= {arXiv preprint arXiv:1905.01039},
year = {2019}
}