中文

警示故事:论参考数据在经验隐私防御中的作用

密码学与安全 2023-10-19 v1 人工智能 机器学习

摘要

在隐私保护机器学习领域,经验隐私防御被提出作为在不显著损失模型效用的前提下实现令人满意训练数据隐私水平的解决方案。大多数针对成员推断攻击的现有防御假设可获取参考数据,即来自与训练数据相同(或相似)底层分布的额外数据集。尽管参考数据被普遍使用,先前工作却鲜少界定并评估参考数据隐私。由于模型效用和/或训练数据隐私的提升可能以牺牲参考数据隐私为代价,必须同时妥善考量这三方面。本文首先考察先前工作中参考数据的可用性及其隐私处理方式,并论证其在公平比较防御方法中的必要性。其次,我们提出一种基线防御,使训练与参考数据的效用—隐私权衡易于理解。我们的方法被表述为带泛化误差约束的经验风险最小化,在实践中可评估为训练与参考数据集上的加权经验风险最小化(WERM)。尽管我们将WERM构想为简单基线,实验却出人意料地显示,在几乎所有参考数据与原训练数据的相对隐私水平下,它都优于使用参考数据、被最广泛研究且当前最先进的经验隐私防御方法。我们的研究还揭示,这些现有方法无法有效以参考数据隐私换取模型效用和/或训练数据隐私。总体而言,本工作强调在比较隐私防御时需对模型效用/训练数据隐私/参考数据隐私这一三元组进行恰当评估。

关键词

引用

@article{arxiv.2310.12112,
  title  = {A Cautionary Tale: On the Role of Reference Data in Empirical Privacy Defenses},
  author = {Caelin G. Kaplan and Chuan Xu and Othmane Marfoq and Giovanni Neglia and Anderson Santana de Oliveira},
  journal= {arXiv preprint arXiv:2310.12112},
  year   = {2023}
}