中文

从私有训练数据中进行深度学习的半监督知识迁移

机器学习 2017-03-06 v4 密码学与安全 机器学习

摘要

某些机器学习应用涉及敏感的训练数据,例如临床试验中患者的病史。模型可能会无意且隐式地存储其部分训练数据;因此,对模型的仔细分析可能会泄露敏感信息。为了解决这个问题,我们展示了一种为训练数据提供强隐私保证的通用适用方法:教师集成的私有聚合 (PATE)。该方法以黑盒方式结合了使用不相交数据集(例如来自不同用户子集的记录)训练的多个模型。由于这些模型直接依赖敏感数据,因此它们不被发布,而是用作“学生”模型的“教师”。学生模型学习预测由所有教师模型通过噪声投票选出的输出,并且无法直接访问单个教师模型或底层数据或参数。学生模型的隐私特性既可以从直观上理解(因为没有单个教师模型从而没有单个数据集主导学生模型的训练),也可以从差分隐私的角度形式化地理解。即使对手不仅可以查询学生模型还可以检查其内部工作原理,这些属性依然成立。与先前的工作相比,该方法对教师模型的训练方式仅施加了很弱的假设:它适用于任何模型,包括像DNN这样的非凸模型。得益于改进的隐私分析和半监督学习,我们在MNIST和SVHN上实现了SOTA的隐私/效用权衡。

关键词

引用

@article{arxiv.1610.05755,
  title  = {Semi-supervised Knowledge Transfer for Deep Learning from Private Training Data},
  author = {Nicolas Papernot and Martín Abadi and Úlfar Erlingsson and Ian Goodfellow and Kunal Talwar},
  journal= {arXiv preprint arXiv:1610.05755},
  year   = {2017}
}

备注

Accepted to ICLR 17 as an oral