从私有与公共种群的混合中学习
机器学习
2020-08-04 v1 机器学习
摘要
我们开启了一项在隐私约束下监督学习新模型的研究。设想一项医学研究,其中数据集采样自由健康与不健康个体构成的种群。假设健康个体无隐私顾虑(此种情况下我们称其数据为“公共”),而不健康个体则希望其数据受到严格隐私保护。在此例中,种群(数据分布)是差异可能极大的私有(不健康)与公共(健康)子种群的混合。受上述例子启发,我们考虑一种模型,其中种群 是两个子种群的混合:一个由私有敏感数据构成的私有子种群 ,以及一个无隐私顾虑数据的公共子种群 。从 抽取的每一例均假设含有一个指示该例为私有或公共的隐私状态位。目标是设计一种仅针对私有样本满足差分隐私的学习算法。此前该情境下的工作假设同质种群,即私有与公共数据来自同一分布,并特别设计了利用此假设的方案。我们以 中线性分类器的学习为案例,展示如何规避该假设。我们表明,在隐私状态与目标标签相关时(如上例), 中线性分类器可在不可知与可实现设定下以与经典(非私有)PAC 学习相当的采样复杂度被学习。已知若所有数据均视为私有则此项任务不可能完成。
引用
@article{arxiv.2008.00331,
title = {Learning from Mixtures of Private and Public Populations},
author = {Raef Bassily and Shay Moran and Anupama Nandi},
journal= {arXiv preprint arXiv:2008.00331},
year = {2020}
}