针对黑盒对抗攻击的有状态检测
密码学与安全
2019-07-15 v1 机器学习
摘要
对抗样本(即针对机器学习分类器的规避攻击)问题已被证明极难解决。即便在许多实际场景中分类器作为远程服务托管、 adversary 无法直接访问模型参数时,情况依然如此。本文认为,在此类场景下,防御者拥有比以往研究所探索的远为广阔的行动空间。具体而言,我们偏离了先前工作所隐含的假设——即防御必须是作用于单个样本的无状态函数——并探索有状态防御的可能性。作为开端,我们开发了一种旨在检测对抗样本生成过程的防御方法。通过保留过往查询的历史记录,防御者可以尝试识别何时一串查询看起来是为了生成对抗样本。随后,我们引入了查询致盲(query blinding),这是一类专为绕过依赖此类防御方法的新型攻击。我们相信,将对抗样本的研究从无状态分类器扩展到有状态系统,不仅对于许多黑盒场景更为现实,也为防御者在应对 adversary 时提供了亟需的优势。
引用
@article{arxiv.1907.05587,
title = {Stateful Detection of Black-Box Adversarial Attacks},
author = {Steven Chen and Nicholas Carlini and David Wagner},
journal= {arXiv preprint arXiv:1907.05587},
year = {2019}
}