基于聚类的标签差分隐私
机器学习
2021-10-06 v1 密码学与安全
数据结构与算法
信息论
math.IT
摘要
我们提出用于\emph{标签差分隐私}的新机制,这是差分隐私机器学习的放宽,仅保护训练集中标签的隐私。我们的机制利用(非私有的)特征向量对训练集中的样本聚类,从同一簇中样本随机重采样各标签,并输出带噪标签的训练集以及真实损失函数的修改版本。我们证明当簇既大且高质量时,在带噪训练集上最小化修改损失的模型以与非私有学习相当的速率收敛到小的超额风险。我们描述了集中式机制(整个训练集由可信 curator 存储)与分布式机制(每用户存单个带标签样本,并以同簇中随机选出的用户标签替换其标签)。我们还描述了一个学习问题,其中大簇对于实现强隐私与良好精确率或良好召回率均属必要。我们的实验表明,与对标签施加均匀随机响应相比,以及与通过 DP-SGD 学习模型相比,在每簇内随机化标签显著改善了隐私-精度权衡。
引用
@article{arxiv.2110.02159,
title = {Label differential privacy via clustering},
author = {Hossein Esfandiari and Vahab Mirrokni and Umar Syed and Sergei Vassilvitskii},
journal= {arXiv preprint arXiv:2110.02159},
year = {2021}
}