利用提取的模型替身改进黑盒攻击
机器学习
2020-11-03 v2 人工智能
计算与语言
摘要
我们提出一种针对阅读理解式问答黑盒模型的对抗样本生成方法。我们的方法由两步组成。首先,我们通过模型提取(Krishna 等,2020)逼近受害黑盒模型。其次,我们使用自身的白盒方法生成使近似模型失效的输入扰动。这些被扰动的输入被用于攻击受害模型。实验中我们发现,相较于在近似模型上执行的 AddAny(一种白盒攻击),我们的方法在 F1 上提升 25%;相较于 AddSent 攻击(一种黑盒攻击,Jia 与 Liang,2017)提升 11% F1。
引用
@article{arxiv.2010.16336,
title = {Leveraging Extracted Model Adversaries for Improved Black Box Attacks},
author = {Naveen Jafer Nizar and Ari Kobren},
journal= {arXiv preprint arXiv:2010.16336},
year = {2020}
}