中文

Updates-Leak:在线学习中的数据集推断与重构攻击

密码学与安全 2019-12-03 v2 机器学习 机器学习

摘要

过去十年间,机器学习(ML)发展迅速,而推动这一发展的主要因素是无前例的大规模数据。由于数据生成是一个连续过程,这导致在在线学习场景下,ML模型拥有者频繁使用新收集的数据更新其模型。因此,如果一个ML模型在两个不同时间点上用同一组数据进行查询,它将给出不同的结果。在本文中,我们研究在被更新前后黑盒ML模型输出的变化是否会泄露用于执行更新的数据集(即更新集)的信息。这构成了针对黑盒ML模型的一种新攻击面,此类信息泄露可能损害ML模型拥有者的知识产权与数据隐私。我们提出了四种遵循编码器-解码器形式的攻击,可推断更新集的多种信息。我们的新攻击借助最先进的深度学习技术实现。特别地,我们提出了一种基于生成对抗网络(GANs)的混合生成模型(CBM-GAN),其包含重构损失以允许重构精确样本。我们的实验表明所提攻击取得了强劲的性能。

关键词

引用

@article{arxiv.1904.01067,
  title  = {Updates-Leak: Data Set Inference and Reconstruction Attacks in Online Learning},
  author = {Ahmed Salem and Apratim Bhattacharya and Michael Backes and Mario Fritz and Yang Zhang},
  journal= {arXiv preprint arXiv:1904.01067},
  year   = {2019}
}

备注

USENIX Security 2020