中文

针对 DNN 的实用无盒对抗攻击

计算机视觉与模式识别 2020-12-07 v1

摘要

深度神经网络(DNN)对抗脆弱性的研究进展迅速。现有攻击需要内部访问(受害模型的架构、参数或训练集)或外部访问(查询模型)。然而,在许多场景中这两种访问均不可行或代价高昂。我们研究无盒对抗样本,其中攻击者既不能访问模型信息或训练集,也不能查询模型。相反,攻击者只能从与受害模型相同的问题域收集少量样本。这种更强的威胁模型极大扩展了对抗攻击的适用性。我们提出三种利用极少量数据集(数十个样本量级)进行训练的机制,并发现原型重建最为有效。我们的实验表明,在原型自编码模型上构造的对抗样本可良好迁移至多种图像分类与人脸验证模型。在 clarifai.com 提供的商用名人识别系统上,我们的方法将该系统的平均预测准确率显著降至仅 15.40%,与从预训练 Arcface 模型迁移对抗样本的攻击效果相当。

关键词

引用

@article{arxiv.2012.02525,
  title  = {Practical No-box Adversarial Attacks against DNNs},
  author = {Qizhang Li and Yiwen Guo and Hao Chen},
  journal= {arXiv preprint arXiv:2012.02525},
  year   = {2020}
}

备注

Accepted by NeurIPS 2020