以更少像素发起攻击:一种精炼任意稠密对抗攻击的概率后验框架
计算机视觉与模式识别
2022-02-22 v2 密码学与安全
机器学习
摘要
深度神经网络图像分类器被报道易受对抗规避攻击的影响,此类攻击使用精心构造的图像来误导分类器。许多对抗攻击属于稠密攻击,即通过扰动自然图像的所有像素来生成对抗样本。为生成稀疏扰动,近期发展了稀疏攻击,其通常是通过对稠密攻击算法施加稀疏正则化得到的独立攻击,导致攻击效率降低。本文旨在从另一视角解决该任务。我们从稠密攻击生成的扰动中筛选出最有效的扰动,基于我们发现稠密攻击在图像上生成的相当一部分扰动对攻击分类器贡献甚微。据此,我们提出一种概率后验框架,通过显著减少被扰动像素的数量但保持其攻击能力来精炼给定的稠密攻击,并以互信息最大化为目标进行训练。对于任意给定的稠密攻击,所提模型具有良好的兼容性,能以更少的扰动使其对抗图像更逼真且更难以被检测。此外,我们的框架执行对抗攻击的速度远快于现有稀疏攻击。
引用
@article{arxiv.2010.06131,
title = {Learning to Attack with Fewer Pixels: A Probabilistic Post-hoc Framework for Refining Arbitrary Dense Adversarial Attacks},
author = {He Zhao and Thanh Nguyen and Trung Le and Paul Montague and Olivier De Vel and Tamas Abraham and Dinh Phung},
journal= {arXiv preprint arXiv:2010.06131},
year = {2022}
}