中文

黑盒范式下可迁移对抗扰动的诱导

机器学习 2021-03-04 v3 机器学习

摘要

对对抗样本(即欺骗分类器的恶意修改样本)日益增长的关注,催生了许多旨在检测它们、使其无害或使模型更鲁棒的防御方法。本文为提升模型针对黑盒迁移攻击的鲁棒性铺平了一种新方法的道路。目标模型中包含一个可移除的附加神经网络,其设计用于诱导“诱导效应”,欺骗 adversary 选择错误方向以愚弄目标模型。该附加模型的训练借助作用于 logits 序列顺序的损失函数实现。我们这种基于欺骗的方法仅需访问目标模型的预测结果,且不需要标注数据集。我们借助鲁棒与非鲁棒有用特征的概念解释了诱导效应,并在 MNIST、SVHN 与 CIFAR10 上开展实验以刻画和评估该现象。此外,我们讨论了两种简单预测方案,并通过实验验证我们的方法可用作防御,高效挫败采用 SOTA 攻击且允许施加大幅扰动的 adversary。

关键词

引用

@article{arxiv.2004.04919,
  title  = {Luring of transferable adversarial perturbations in the black-box paradigm},
  author = {Rémi Bernhard and Pierre-Alain Moellic and Jean-Max Dutertre},
  journal= {arXiv preprint arXiv:2004.04919},
  year   = {2021}
}