中文

类别不平衡下的差分隐私:方法与实证洞察

机器学习 2024-11-11 v1 密码学与安全

摘要

类别不平衡学习发生在训练数据中类别标签分布高度偏斜的分类场景中,例如预测罕见疾病或欺诈检测。这种类别不平衡带来了显著的算法挑战,当差分隐私等隐私保护技术被应用于保护敏感训练数据时,这一挑战可能进一步加剧。本文形式化了这些挑战并提供了若干算法解决方案。我们考虑了预处理方法的差分隐私变体,这些方法私有地增强原始数据集以减少类别不平衡,包括过采样、SMOTE 和私有合成数据生成。我们还考虑了处理方法的差分隐私变体,这些方法调整学习算法以适应不平衡,包括模型集成、类别加权经验风险最小化和类别加权深度学习。对于每种方法,我们要么将现有的不平衡学习技术适配到隐私保护设置中,要么证明其与差分隐私的不兼容性。最后,我们在各种数据和分布设置下实证评估了这些隐私保护的不平衡学习方法。我们发现私有合成数据方法在数据预处理步骤中表现良好,而类别加权经验风险最小化是在高维设置中私有合成数据遭受维度灾难时的一种替代方案。

关键词

引用

@article{arxiv.2411.05733,
  title  = {Differential Privacy Under Class Imbalance: Methods and Empirical Insights},
  author = {Lucas Rosenblatt and Yuliia Lut and Eitan Turok and Marco Avella-Medina and Rachel Cummings},
  journal= {arXiv preprint arXiv:2411.05733},
  year   = {2024}
}

备注

14 pages