面向外包用户生成数据的随机线性分类器机密提升方法
密码学与安全
2019-05-02 v4 机器学习
摘要
用户生成数据在许多应用的预测建模中至关重要。借助 Web/移动/可穿戴接口,数据所有者可持续记录分布式用户生成的数据,并从中构建各种预测模型以改进其运营、服务与收益。由于用户数据规模大且不断演化,数据所有者可依赖公共云服务提供商(Cloud)实现存储与计算的可扩展性。将敏感的用户生成数据与高级分析模型暴露给 Cloud 会引发隐私担忧。我们提出一个机密学习框架 SecureBoost,面向希望从聚合用户生成数据中学习预测模型、但又将存储与计算负担卸载给 Cloud 且无需担忧保护敏感数据的数据所有者。SecureBoost 允许用户直接向指定 Cloud 提交加密或随机掩蔽的数据。我们的框架利用随机线性分类器(RLCs)作为提升框架中的基分类器,极大简化了所提机密提升协议的设计,同时仍保持模型质量。采用密码服务提供商(CSP)协助 Cloud 的处理,降低了协议构造的复杂度。我们给出 SecureBoost 的两种构造:HE+GC 与 SecSh+GC,结合同态加密、混淆电路与随机掩蔽以实现安全性与效率。对于提升模型,Cloud 仅学习 RLCs,CSP 仅学习 RLCs 的权重。最后,数据所有者收集两部分得到完整模型。我们进行了大量实验以理解基于 RLC 的提升的质量与各构造的成本分布。结果表明 SecureBoost 能从受保护的用户生成数据高效学习高质量提升模型。
引用
@article{arxiv.1802.08288,
title = {Confidential Boosting with Random Linear Classifiers for Outsourced User-generated Data},
author = {Sagar Sharma and Keke Chen},
journal= {arXiv preprint arXiv:1802.08288},
year = {2019}
}