中文

从多方数据中进行隐私学习

机器学习 2016-02-12 v1 密码学与安全

摘要

从多个参与方收集的私有数据学习分类器是一个重要问题,具有许多潜在应用。我们如何在无法访问任何一方私有数据的情况下,通过组合不同方本地训练的分类器,构建一个准确且差分隐私的全局分类器?我们提出通过首先从辅助无标签数据生成有标签数据,然后训练一个全局 ϵ\epsilon-差分隐私分类器,来迁移本地分类器集成体的“知识”。我们指出多数投票过于敏感,因此提出一种由集成体估计的类别概率加权的新型风险。相对于非隐私方案,我们的隐私方案的泛化误差上界为 O(ϵ2M2)O(\epsilon^{-2}M^{-2}),其中 MM 为参与方数量。这使得在 MM 较大(例如群智感知应用中)时能够实现强隐私而无性能损失。我们通过活动识别、网络入侵检测和恶意 URL 检测等实际任务展示了我们方法的性能。

关键词

引用

@article{arxiv.1602.03552,
  title  = {Learning Privately from Multiparty Data},
  author = {Jihun Hamm and Paul Cao and Mikhail Belkin},
  journal= {arXiv preprint arXiv:1602.03552},
  year   = {2016}
}