通过输入去噪与特征恢复增强对抗攻击防御
计算机视觉与模式识别
2021-11-22 v1 机器学习
摘要
尽管深度神经网络(DNNs)在各种应用中取得了卓越性能,但众所周知 DNNs 易受热清洁/原始样本中具有难以察觉扰动的对样本(AEs)的攻击。为克服现有防御方法对抗攻击的弱点——其破坏了原始样本的信息,导致目标分类器精度下降,本文提出一种增强的对抗攻击防御方法 IDFR(通过输入去噪与特征恢复)。所提 IDFR 由基于凸包优化的增强输入去噪器(ID)与隐藏有损特征恢复器(FR)构成。在基准数据集上的大量实验表明,所提 IDFR 优于多种最先进(SOTA)防御方法,且对保护目标模型抵御各类对抗黑盒或白盒攻击极为有效。\footnote{源代码发布于: \href{https://github.com/ID-FR/IDFR}{https://github.com/ID-FR/IDFR}}
引用
@article{arxiv.2111.10075,
title = {Enhanced countering adversarial attacks via input denoising and feature restoring},
author = {Yanni Li and Wenhui Zhang and Jiawei Liu and Xiaoli Kou and Hui Li and Jiangtao Cui},
journal= {arXiv preprint arXiv:2111.10075},
year = {2021}
}