中文

通过新型集成架构的自蒸馏缓解成员推断攻击

密码学与安全 2021-10-19 v1 机器学习

摘要

成员推断攻击是评估机器学习(ML)模型隐私泄露的关键手段。这些攻击旨在利用模型在成员与非成员输入上的差异行为,区分训练成员与非成员。本工作的目标是训练具有高成员隐私且基本保持效用的ML模型;因此我们追求经验性成员隐私保证,而非差分隐私等技术所提供的可证明隐私保证,因为后者被证明会损害模型效用。具体而言,我们提出一种训练隐私保护模型的新框架,其通过诱导成员与非成员输入上的相似行为来缓解成员推断攻击。我们的框架称为SELENA,包含两个主要组件。第一个组件也是我们的防御核心,是一种用于训练的 novel 集成架构。该架构我们称为Split-AI,将训练数据随机划分为子集,并在每个子集上训练一个模型。我们在测试时采用自适应推理策略:我们的集成架构仅聚合那些训练数据中不含该输入样本的模型的输出。我们证明Split-AI架构可防御一大类成员推断攻击,但它易受新型自适应攻击。因此,我们在框架中使用第二个组件,称为自蒸馏(Self-Distillation),以抵御此类更强攻击。自蒸馏组件通过我们的Split-AI集成对训练数据集进行(自我)蒸馏,无需使用任何外部公开数据集。通过在主要基准数据集上的大量实验,我们表明SELENA在成员隐私与效用之间呈现出优于现有最优方法的权衡。

关键词

引用

@article{arxiv.2110.08324,
  title  = {Mitigating Membership Inference Attacks by Self-Distillation Through a Novel Ensemble Architecture},
  author = {Xinyu Tang and Saeed Mahloujifar and Liwei Song and Virat Shejwalkar and Milad Nasr and Amir Houmansadr and Prateek Mittal},
  journal= {arXiv preprint arXiv:2110.08324},
  year   = {2021}
}