从聚合数据学习:精选袋与随机袋
机器学习
2023-05-19 v2 人工智能
机器学习
摘要
保护用户隐私是许多大规模部署并从多样化人群中收集数据的机器学习系统的主要关切。解决此问题的一种方法是以聚合方式收集和发布数据标签,从而使单个用户的信息可能与其他人合并。在本文中,我们探索使用聚合数据标签而非个体标签训练机器学习模型的可能性。具体而言,我们考虑从业者提出的两种自然聚合过程:基于共同特征对数据点分组的精选袋,以及将数据点随机分组为相似大小袋的随机袋。对于精选袋设置以及广泛的损失函数,我们表明可以在不出现因数据聚合可能导致的性能下降的情况下进行基于梯度的学习。我们的方法基于如下观察:精选袋中个体数据样本上损失函数的梯度之和可从聚合标签计算得出,而无需个体标签。对于随机袋设置,我们基于假设类的Rademacher复杂度给出了泛化风险界,并展示了如何对经验风险最小化进行正则化以实现最小风险界。事实上,在随机袋设置中,如我们的界所示,袋的大小与可实现的错误率之间存在权衡。最后,我们进行了细致的实证研究以确认我们的理论发现。特别是,我们的结果表明聚合学习可以在保持模型准确性的同时成为保护用户隐私的有效方法。
引用
@article{arxiv.2305.09557,
title = {Learning from Aggregated Data: Curated Bags versus Random Bags},
author = {Lin Chen and Gang Fu and Amin Karbasi and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2305.09557},
year = {2023}
}