RayS:一种用于硬标签对抗攻击的射线搜索方法
机器学习
2020-09-08 v2 人工智能
机器学习
摘要
深度神经网络易受对抗攻击。在不同攻击设定中,最具挑战性也最实用的是硬标签设定,此时攻击者仅能获取目标模型的硬标签输出(预测标签)。已有尝试在广泛使用的 范数威胁模型下,无论就攻击成功率还是查询复杂度而言均不够有效或高效。本文提出射线搜索攻击(RayS),大幅提升了硬标签攻击的有效性与效率。与以往工作不同,我们将寻找最近决策边界的连续问题重构为无需任何零阶梯度估计的离散问题。同时,通过快速检验步骤消除了所有不必要的搜索,显著减少了硬标签攻击所需查询次数。此外,有趣的是,我们发现所提 RayS 攻击亦可用作对可能“虚假鲁棒”模型的健全性检查。在数个宣称达到最优鲁棒精度的近期防御方法上,我们的攻击表明当前白盒/黑盒攻击仍可能给出错误的安全感,且最流行的 PGD 攻击与 RayS 攻击间的鲁棒精度下降可达 。我们相信所提 RayS 攻击有助于识别能击败多数白盒/黑盒攻击的虚假鲁棒模型。
引用
@article{arxiv.2006.12792,
title = {RayS: A Ray Searching Method for Hard-label Adversarial Attack},
author = {Jinghui Chen and Quanquan Gu},
journal= {arXiv preprint arXiv:2006.12792},
year = {2020}
}
备注
9 pages, 4 figures, 9 tables. In KDD 2020