中文

利用提取的模型替身改进黑盒攻击

机器学习 2020-11-03 v2 人工智能 计算与语言

摘要

我们提出一种针对阅读理解式问答黑盒模型的对抗样本生成方法。我们的方法由两步组成。首先,我们通过模型提取(Krishna 等,2020)逼近受害黑盒模型。其次,我们使用自身的白盒方法生成使近似模型失效的输入扰动。这些被扰动的输入被用于攻击受害模型。实验中我们发现,相较于在近似模型上执行的 AddAny(一种白盒攻击),我们的方法在 F1 上提升 25%;相较于 AddSent 攻击(一种黑盒攻击,Jia 与 Liang,2017)提升 11% F1。

关键词

引用

@article{arxiv.2010.16336,
  title  = {Leveraging Extracted Model Adversaries for Improved Black Box Attacks},
  author = {Naveen Jafer Nizar and Ari Kobren},
  journal= {arXiv preprint arXiv:2010.16336},
  year   = {2020}
}