中文

校准差分隐私机器学习的实际隐私风险

机器学习 2024-10-31 v1 密码学与安全

摘要

差分隐私通过隐私预算 ϵ\epsilon 量化隐私,但其实际解释因模型和数据集的不同而变得复杂。近期关于差分隐私机器学习和成员推理的研究表明,在相同的理论 ϵ\epsilon 设置下,基于似然比的成员推理攻击(LiRA)成功率(ASR)可能因具体数据集和模型而异,这可能是评估现实世界隐私风险的更好指标。受这种实用隐私度量的启发,我们研究了可以降低攻击成功率的方法,以便在模型训练中实现更灵活的隐私预算设置。我们发现,通过选择性地抑制隐私敏感特征,可以在不损害特定应用数据效用的情况下实现更低的 ASR 值。我们使用 SHAP 和 LIME 模型解释器来评估特征敏感性,并开发了特征掩码策略。我们的研究结果表明,模型 MM 上的 LiRA ASRMASR^M 可以恰当地指示数据集用于建模的内在隐私风险,并且可以通过修改数据集来使用更大的理论 ϵ\epsilon 设置,以实现等效的实际隐私保护。我们进行了大量实验,以展示 ASR 与数据集隐私风险之间的内在联系。通过精心选择要掩码的特征,我们可以在等效的实际隐私保护和放宽的 ϵ\epsilon 设置下保留更多的数据效用。实现细节已在提供的 GitHub URL \url{https://anonymous.4open.science/r/On-sensitive-features-and-empirical-epsilon-lower-bounds-BF67/} 上在线共享。

关键词

引用

@article{arxiv.2410.22673,
  title  = {Calibrating Practical Privacy Risks for Differentially Private Machine Learning},
  author = {Yuechun Gu and Keke Chen},
  journal= {arXiv preprint arXiv:2410.22673},
  year   = {2024}
}