逆向工程 $\ell_p$ 攻击:一种具有恢复保证的块稀疏优化方法
机器学习
2022-03-10 v1
摘要
基于深度神经网络的分类器已被证明容易受到对其输入的不可感知扰动的影响,例如 范数有界对抗攻击。这促使了许多防御方法的开发,随后这些方法又被新的攻击所破解,如此循环。本文关注一个不同但相关的问题,即逆向工程对抗攻击。具体而言,给定一个受攻击信号,我们研究在何种条件下可以确定攻击类型(、 或 )并恢复干净信号。我们将此问题转化为块稀疏恢复问题,其中信号和攻击均假定位于一个子空间并集中,该并集包含每个类别一个子空间和每种攻击类型一个子空间。我们推导了子空间的几何条件,在此条件下任何受攻击信号都可以被分解为干净信号与攻击之和。此外,通过确定包含信号和攻击的子空间,我们还可以对信号进行分类并确定攻击类型。在数字和人脸分类上的实验证明了所提方法的有效性。
引用
@article{arxiv.2203.04886,
title = {Reverse Engineering $\ell_p$ attacks: A block-sparse optimization approach with recovery guarantees},
author = {Darshan Thaker and Paris Giampouras and René Vidal},
journal= {arXiv preprint arXiv:2203.04886},
year = {2022}
}