中文

面向有序 Top-k 攻击的对抗蒸馏

机器学习 2019-05-28 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)易受对抗攻击,尤其是白盒定向攻击。一种学习攻击的方案是设计合适的对抗目标函数,从而对任意测试图像产生难以察觉的扰动(例如 Carlini-Wagner(C&W)方法)。大多数方法以 Top-1 方式处理定向攻击。在本文中,我们提出针对图像分类任务学习有序 Top-k 攻击(k>=1),即强制对抗样本的前 k 个预测标签为 k 个(随机)选定且有序的标签(真实标签除外)。为此,我们提出一种对抗蒸馏框架:首先,针对测试图像的真实标签,为任意给定的有序 Top-k 目标标签计算对抗概率分布。然后,我们通过最小化 Kullback-Leibler(KL)散度以及扰动能量惩罚来学习对抗样本,其精神类似于网络蒸馏方法。我们探索如何在计算目标分布时利用标签语义相似性,从而产生面向知识的攻击。在实验中,我们使用在干净 ImageNet-1000 训练集上训练的两个流行 DNN(ResNet-50 和 DenseNet-121),在 ImageNet-1000 验证数据集上彻底测试了 Top-1 和 Top-5 攻击。对于两种模型,我们提出的对抗蒸馏方法在 Top-1 设定下优于 C&W 方法以及其他基线方法。我们的方法在 Top-5 设定下针对一种强化的改进 C&W 方法表现出显著改进。

关键词

引用

@article{arxiv.1905.10695,
  title  = {Adversarial Distillation for Ordered Top-k Attacks},
  author = {Zekun Zhang and Tianfu Wu},
  journal= {arXiv preprint arXiv:1905.10695},
  year   = {2019}
}

备注

10 pages