通用基于决策的黑盒扰动:打破通过模糊实现安全的防御
机器学习
2018-11-14 v2 人工智能
密码学与安全
机器学习
摘要
我们研究在硬标签黑盒设定下寻找通用(与图像无关)扰动以欺骗机器学习(ML)分类器(例如神经网络、决策树)的问题。近期在白盒设定(模型参数已知)下对抗机器学习的研究表明,许多最先进的图像分类器易受通用对抗扰动的影响:一个固定的人眼不可察觉的扰动,当被加到任意图像上时,会以高概率导致其被误分类 Kurakin et al. [2016], Szegedy et al. [2013], Chen et al. [2017a], Carlini and Wagner [2017]。本文考虑一个更实际且更具挑战性的问题,即在模糊(或黑盒)设定下寻找此类通用扰动。更具体地,我们利用零阶优化算法,在除攻击者可发起查询探测分类器外不泄露任何模型信息的情况下,寻找此类通用对抗扰动。我们进一步放宽了查询输出为所有类别的连续值置信度的假设,并考虑输出为硬标签决策的情形。令人惊讶的是,我们发现即便在这些极度模糊的机制下,最先进的 ML 分类器仍可通过向任意自然图像添加单个人眼不可察觉的图像扰动而以非常高概率被欺骗。硬标签黑盒设定下通用扰动的惊人存在,引发了对一种通用噪声向量存在的严重安全担忧,攻击者可能利用该向量在大多数自然图像上攻破分类器。
引用
@article{arxiv.1811.03733,
title = {Universal Decision-Based Black-Box Perturbations: Breaking Security-Through-Obscurity Defenses},
author = {Thomas A. Hogan and Bhavya Kailkhura},
journal= {arXiv preprint arXiv:1811.03733},
year = {2018}
}