中文

通过利用损失轨迹的成员推断攻击

密码学与安全 2022-09-01 v1 机器学习

摘要

机器学习模型易受成员推断攻击,其中 adversary 旨在预测特定样本是否包含于目标模型的训练数据集中。现有攻击方法通常仅利用给定目标模型的输出信息(大多为损失)。结果,在成员与非成员样本均产生相似小损失的实际场景中,这些方法自然无法区分二者。为应对此局限,本文提出一种称为\system的新攻击方法,其可从目标模型的整个训练过程中利用成员信息以提升攻击性能。为在常见黑盒设定下实施攻击,我们借助知识蒸馏,并以在不同蒸馏 epoch 的一系列中间模型上评估的损失(即\emph{蒸馏损失轨迹})连同给定目标模型的损失来表示成员信息。在不同数据集与模型架构上的实验结果展示了我们的攻击在不同指标下的巨大优势。例如,在CINIC-10上,我们的攻击在0.1%的低假正率下实现了至少比现有方法高6×\times的真正率。进一步分析证明了我们的攻击在更严格场景下的普遍有效性。

关键词

引用

@article{arxiv.2208.14933,
  title  = {Membership Inference Attacks by Exploiting Loss Trajectory},
  author = {Yiyong Liu and Zhengyu Zhao and Michael Backes and Yang Zhang},
  journal= {arXiv preprint arXiv:2208.14933},
  year   = {2022}
}

备注

Accepted by CCS 2022