通过差分私有模型聚合提升模型性能
机器学习
2018-12-05 v2 机器学习
摘要
开发高性能机器学习模型的一个关键因素是具备足够大的数据集。本工作受软件即服务(SaaS)公司中的应用所驱动,其中存在来自多个客户公司的众多相似但互不相交的数据集。为克服数据不足的难题,同时因隐私顾虑而不显式聚合客户端数据集,一种方案是为每个单独客户端收集更多数据,另一种是对各客户端数据上训练的模型信息进行私有聚合。本工作中提出两种私有模型聚合方法,能够将已有在其他公司数据集上训练的模型的知识迁移至标注数据有限的新公司,同时保护各客户公司的底层个体敏感信息。所提两种方法基于最先进的私有学习算法:差分私有基于置换的随机梯度下降与近似极小值扰动。我们通过实验表明,利用差分私有技术,可实现私有模型聚合并增强数据效用,同时提供可证明的隐私数学保证。因此所提方法为 SaaS 公司及其客户提供了显著的商业价值,特别是作为冷启动问题的一种解决方案。
引用
@article{arxiv.1811.04911,
title = {Boosting Model Performance through Differentially Private Model Aggregation},
author = {Sophia Collet and Robert Dadashi and Zahi N. Karam and Chang Liu and Parinaz Sobhani and Yevgeniy Vahlis and Ji Chao Zhang},
journal= {arXiv preprint arXiv:1811.04911},
year = {2018}
}