基于条件生成模型反演的对抗鲁棒分类
机器学习
2022-01-14 v1 计算机视觉与模式识别
摘要
大多数对抗攻击防御方法依赖于混淆梯度。这些方法在防御基于梯度的攻击时取得成功;然而,它们很容易被不使用梯度或近似并使用修正梯度的攻击所规避。诸如对抗训练等不混淆梯度的方法存在,但这些方法通常对攻击作出假设,例如其量级。我们提出了一种不混淆梯度且无需假设攻击先验知识、从构造上即具鲁棒性的分类模型。我们的方法将分类表述为一个优化问题,其中我们“反演”一个在未被扰动的自然图像上训练的条件生成器,以找到生成最接近查询图像样本的类。我们假设,对抗攻击脆弱性的一个潜在来源是前馈分类器从高维到低维的特性,这使得 adversary 能够在输入空间中找到微小扰动从而导致输出空间的巨大变化。另一方面,生成模型通常是低维到高维的映射。尽管该方法与 Defense-GAN 相关,但我们的模型使用条件生成模型及反演而非前馈分类器是关键区别。与已被证明会产生易被规避的混淆梯度的 Defense-GAN 不同,我们表明我们的方法不混淆梯度。我们证明了我们的模型对黑盒攻击极其鲁棒,且与自然训练的前馈分类器相比对白盒攻击具有改进的鲁棒性。
引用
@article{arxiv.2201.04733,
title = {Adversarially Robust Classification by Conditional Generative Model Inversion},
author = {Mitra Alirezaei and Tolga Tasdizen},
journal= {arXiv preprint arXiv:2201.04733},
year = {2022}
}