中文

基于 Huber 损失最小化的用户级差分隐私下均值估计

机器学习 2024-10-25 v2 密码学与安全

摘要

用户整个贡献样本的隐私保护在分布式系统中至关重要。最有效的方法是两阶段方案,即先找到一个小区间,然后通过将样本裁剪到该区间来获得更精细的估计。然而,裁剪操作会引入偏差,如果样本分布为重尾分布则偏差尤为严重。此外,具有大局部样本数的用户会使敏感性更大,因此该方法不适用于不平衡的用户。受这些挑战的启发,我们提出了一种在用户级差分隐私下对均值进行 Huber 损失最小化的方法。Huber 损失的连接点可以自适应地用于处理不平衡的用户。此外,它避免了裁剪操作,从而显著降低了与两阶段方法相比的偏差。我们对该方法进行理论分析,给出用于隐私保护的噪声强度以及均方误差的上界。结果表明,新方法对用户样本大小的不平衡以及样本分布的尾部更不敏感。最后,我们进行数值实验来验证我们的理论分析。

关键词

引用

@article{arxiv.2405.13453,
  title  = {A Huber Loss Minimization Approach to Mean Estimation under User-level Differential Privacy},
  author = {Puning Zhao and Lifeng Lai and Li Shen and Qingming Li and Jiafei Wu and Zhe Liu},
  journal= {arXiv preprint arXiv:2405.13453},
  year   = {2024}
}