中文

查询高效硬标签黑盒攻击:一种基于优化的方法

机器学习 2018-07-13 v1 人工智能 机器学习

摘要

我们研究在硬标签黑盒设定下攻击机器学习模型的问题,其中除攻击者可通过查询探测相应的硬标签决策外,不泄露任何模型信息。这是一个极具挑战性的问题,因为将最先进的白盒攻击(如 CW 或 PGD)直接推广到硬标签黑盒设定将需要最小化一个非连续阶跃函数,这是组合性的且无法由基于梯度的优化器求解。当前唯一的方法基于边界上的随机游走,其需要大量查询且缺乏收敛保证。我们提出一种将硬标签黑盒攻击表述为实值优化问题的新方式,该问题通常是连续的且可由任意零阶优化算法求解。例如,使用随机无梯度方法,我们能够界定算法达到驻点所需迭代次数。我们证明所提方法在 MNIST、CIFAR 和 ImageNet 数据集上攻击卷积神经网络时优于以往的随机游走方法。更有趣的是,我们表明所提算法也可用于攻击其他离散且非连续的机器学习模型,如梯度提升决策树(GBDT)。

关键词

引用

@article{arxiv.1807.04457,
  title  = {Query-Efficient Hard-label Black-box Attack:An Optimization-based Approach},
  author = {Minhao Cheng and Thong Le and Pin-Yu Chen and Jinfeng Yi and Huan Zhang and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:1807.04457},
  year   = {2018}
}