中文

评估图像数据集特征对隐私保护机器学习的影响

机器学习 2026-02-03 v2 人工智能 密码学与安全 计算机视觉与模式识别 数据库

摘要

机器学习 (ML) 在包括计算机视觉在内的多个领域发挥着 crucial 作用。然而,训练在敏感数据上的 ML 模型面临着 security 挑战,由于它们可能被攻击并泄露信息。隐私保护机器学习 (PPML) 通过使用差分隐私 (DP) 来平衡 utility 与 privacy 以应对这一问题。本研究识别影响 private 和 non-private 卷积神经网络 (CNN) 模型 utility 与 vulnerability 的图像数据集特征。通过分析多个数据集和 privacy budgets,我们发现不平衡数据集会增加 minority classes 的 vulnerability,但 DP 能有效缓解这一问题。具有更少类别的数据集可提高模型的 utility 和 privacy,而高熵或低 Fisher 判别比 (FDR) 的数据集则恶化了 utility-privacy 的 trade-off。这些见解为 practitioner 和 researcher 提供了有价值的指导,帮助其在基于数据集特征估计和优化 utility-privacy trade-off,从而为更好的结果指明了基于数据集特征进行数据和隐私修改的方向。

关键词

引用

@article{arxiv.2409.01329,
  title  = {Assessing the Impact of Image Dataset Features on Privacy-Preserving Machine Learning},
  author = {Lucas Lange and Maurice-Maximilian Heykeroth and Erhard Rahm},
  journal= {arXiv preprint arXiv:2409.01329},
  year   = {2026}
}

备注

Accepted at 21st Conference on Database Systems for Business, Technology and Web (BTW 2025)