中文

当源模型与目标模型无标签空间重叠时,定向对抗样本能否迁移?

机器学习 2021-03-19 v1

摘要

我们为如下环境设计黑盒基于迁移的定向对抗攻击:攻击者的源模型与目标黑盒模型可能具有不相交的标签空间与训练数据集。该场景与“标准”黑盒设置显著不同,需要一种独特的攻击过程方法。我们的方法始于构建白盒与黑盒标签集之间的类别对应矩阵。在攻击的在线阶段,我们利用来自白盒分布的高度相关代理类别的表示,欺骗黑盒模型预测所需目标类别。我们的攻击在三个复杂且具挑战性的测试环境中评估,其中源模型与目标模型在其独特类别间具有不同程度的概念重叠。最终,我们发现确实可能在具有非重叠标签空间的模型间构造定向基于迁移的对抗攻击!我们还分析了攻击成功对干净数据属性的敏感性。最后,我们展示当与基于查询的方法结合时,我们的迁移攻击作为强大的对抗先验,显著提升了查询效率与对抗成功率。

关键词

引用

@article{arxiv.2103.09916,
  title  = {Can Targeted Adversarial Examples Transfer When the Source and Target Models Have No Label Space Overlap?},
  author = {Nathan Inkawhich and Kevin J Liang and Jingyang Zhang and Huanrui Yang and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2103.09916},
  year   = {2021}
}