基于 PATE 的可扩展隐私保护学习
机器学习
2018-02-27 v1 密码学与安全
机器学习
摘要
机器学习的快速采用加剧了对在敏感数据(如医疗记录或其他个人信息)上训练的机器学习模型隐私影响的担忧。为应对这些担忧,一个有前景的方法是教师集成隐私聚合(Private Aggregation of Teacher Ensembles,PATE),它将一个“教师”模型集成体的知识迁移给一个“学生”模型,通过在互不相交的数据上训练教师提供直观隐私,并通过教师答案的加噪聚合提供强隐私保证。然而,PATE 迄今仅在 MNIST 等简单分类任务上评估过,其在更大规模学习任务和真实世界数据集上的效用尚不清楚。在本工作中,我们展示了 PATE 如何扩展到具有大量输出类别以及含错误的未筛选、不平衡训练数据的学习任务。为此,我们引入了更具选择性且添加更少噪声的新的教师集成加噪聚合机制,并证明了它们更紧的差分隐私保证。我们的新机制基于两点洞见:使用更集中的噪声可增加教师共识的机会;若缺乏共识,则无需向学生给出任何答案。所使用的共识答案更可能是正确的,提供更好的直观隐私,并产生更低差分隐私代价。我们的评估表明,我们的机制在所有指标上均优于原始 PATE,并可扩展到更大任务,同时具备高效用与非常强的隐私(ε < 1.0)。
引用
@article{arxiv.1802.08908,
title = {Scalable Private Learning with PATE},
author = {Nicolas Papernot and Shuang Song and Ilya Mironov and Ananth Raghunathan and Kunal Talwar and Úlfar Erlingsson},
journal= {arXiv preprint arXiv:1802.08908},
year = {2018}
}
备注
Published as a conference paper at ICLR 2018