中文

通过恶意生成模型对机器学习分类器实施中间人攻击

密码学与安全 2019-10-16 v1 机器学习

摘要

深度神经网络(DNNs)易受精心构造的对抗样本攻击。过去几年中,人们投入大量精力探索查询优化攻击以寻找黑盒或白盒 DNN 模型的对抗样本,以及针对这些攻击的防御对策。本工作中,我们在中间人(MitM)攻击视角下探索 DNN 模型的漏洞,此前尚未有此类研究。从 MitM 攻击者的角度看,上述对抗样本攻击不再可行。首先,此类攻击在实际发动前必须多次获取模型输出,这对 MitM 攻击者而言难以实现。其次,此类攻击是一次性的,无法直接推广到新数据样本,降低了攻击者的回报率。相反,使用生成模型即时构造对抗样本可缓解这些缺陷。然而,生成模型(如变分自编码器(VAE))的对抗能力尚未被充分研究。因此,给定一个分类器,我们研究使用 VAE 解码器将良性输入转换为其对抗对应物,或将来自良性 VAE 编码器的输出解码为对抗样本。所提方法可赋予 MitM 攻击者更强能力。基于我们的评估,所提攻击在 MNIST 与 CIFAR10 数据集上均可达到 95% 以上的成功率,优于或可与最先进的查询优化攻击相媲美。同时,该攻击比查询优化攻击快 104 倍。

关键词

引用

@article{arxiv.1910.06838,
  title  = {Man-in-the-Middle Attacks against Machine Learning Classifiers via Malicious Generative Models},
  author = {Derui and Wang and Chaoran Li and Sheng Wen and Surya Nepal and Yang Xiang},
  journal= {arXiv preprint arXiv:1910.06838},
  year   = {2019}
}