中文

基于秘密向量机的隐私保护分类

机器学习 2020-08-21 v2 密码学与安全 机器学习

摘要

如今,大量有价值数据分布在数百万用户持有设备(如个人电脑、手机或物联网设备)中。许多公司收集此类数据以训练机器学习模型,从而改进其服务。然而,用户持有数据往往敏感,收集它在隐私方面存在问题。我们通过提出一种在分布式环境下训练有监督分类器的新方法来解决此问题,该方法类似于近期提出的联邦学习范式,但具有更严格的隐私要求:训练模型的服务器被假定为不可信且可能恶意。因此我们由设计而非信任来保障用户隐私。具体而言,我们的框架称为秘密向量机(SecVM),提供了一种在如下设定中训练线性支持向量机(SVM)的算法:持有数据的客户端与不可信服务器通过交换旨在不泄露任何个人可识别信息的消息进行通信。我们从两方面评估模型。首先,在离线评估中,我们训练 SecVM 从推文预测用户性别,表明可在不牺牲分类性能的前提下保护用户隐私。其次,我们在 Cliqz 网页浏览器中实现 SecVM 的分布式框架,并在有数千客户端的大规模在线评估中部署以预测用户性别,大幅优于基线,从而展示 SecVM 适用于生产环境。

关键词

引用

@article{arxiv.1907.03373,
  title  = {Privacy-Preserving Classification with Secret Vector Machines},
  author = {Valentin Hartmann and Konark Modi and Josep M. Pujol and Robert West},
  journal= {arXiv preprint arXiv:1907.03373},
  year   = {2020}
}

备注

10 pages, 7 figures