中文

面向黑盒模型的对抗特征向量攻击

机器学习 2020-09-02 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

黑盒对抗攻击因其在 AI 安全中的实际用途而吸引了大量研究兴趣。相比白盒攻击,黑盒设定因与被攻击模型相关的可用信息更少以及查询预算的额外约束而更为困难。提升攻击效率的通用方法是借助预训练的可迁移白盒模型。本文提出一种可迁移黑盒攻击的新设定:攻击者可使用来自具有可用网络参数的预训练模型的外部信息,然而与先前研究不同,不允许使用额外训练数据进一步改变或调优预训练模型。为此,我们进一步提出一种新算法 EigenBA 以解决此问题。我们的方法旨在探索黑盒模型更多梯度信息并提升攻击效率,同时利用预训练白盒模型的雅可比矩阵保持对原被攻击图像的小扰动。我们展示最优扰动与雅可比矩阵的右奇异向量密切相关。在 ImageNet 与 CIFAR-10 上的进一步实验表明,即便不可学习的预训练白盒模型也能显著提振黑盒攻击效率,且我们所提方法可进一步提升攻击效率。

关键词

引用

@article{arxiv.2009.00097,
  title  = {Adversarial Eigen Attack on Black-Box Models},
  author = {Linjun Zhou and Peng Cui and Yinan Jiang and Shiqiang Yang},
  journal= {arXiv preprint arXiv:2009.00097},
  year   = {2020}
}