仅查询一次:以最小重复查询实现有效的黑盒对抗攻击
机器学习
2021-02-02 v1 密码学与安全
摘要
研究者已多次表明,即使在仅能查询分类器的“黑盒”设定下,也有可能构造对抗攻击(使类别标签显著改变的小扰动)。然而,黑盒设定下的已有工作均通过以微小修改反复查询同一图像(通常上千次或更多)来攻击分类器,这使得防御者易于检测即将发生的攻击。在本工作中,我们转而表明,在黑盒设定下,通过仅对一系列不同图像各查询一次,即可构造(通用)对抗扰动。该攻击避免了由大量相似查询引起的检测,并产生一种施加于分类器任意输入时均导致误分类的扰动。在实验中,我们表明遵循此限制的攻击可产生非定向对抗扰动,能欺骗绝大多数 MNIST 与 CIFAR-10 分类器输入,以及在 ImageNet 分类器上超过 的输入。在定向设定下,我们展示了在每图像仅允许一次查询时成功率高于 、每图像允许两次查询时达 的 ImageNet 分类器定向黑盒通用攻击。
引用
@article{arxiv.2102.00029,
title = {You Only Query Once: Effective Black Box Adversarial Attacks with Minimal Repeated Queries},
author = {Devin Willmott and Anit Kumar Sahu and Fatemeh Sheikholeslami and Filipe Condessa and Zico Kolter},
journal= {arXiv preprint arXiv:2102.00029},
year = {2021}
}