抵御语义保持对抗攻击的鲁棒深度学习模型
机器学习
2023-04-11 v1
摘要
深度学习模型可能被微小的 范数对抗扰动以及属性层面的自然扰动所欺骗。尽管针对各类扰动的鲁棒性已被分别探讨,但有效应对联合扰动的鲁棒性仍具挑战。本文通过提出一种称为语义保持对抗(Semantic-Preserving Adversarial, SPA)攻击的新机制来研究深度学习模型在联合扰动下的鲁棒性,该机制可用于增强对抗训练。具体而言,我们引入属性操纵器以生成自然且人类可理解的扰动,以及噪声生成器以生成多样的对抗噪声。基于此类组合噪声,我们同时优化属性值与多样性变量以生成联合扰动样本。对于鲁棒训练,我们对深度学习模型针对所生成的联合扰动进行对抗训练。在四个基准上的实证结果表明,在较小的 范数球约束下,SPA 攻击相比现有方法导致了更大的性能下降。此外,我们的 SPA 增强训练在应对此类联合扰动时优于现有的防御方法。
引用
@article{arxiv.2304.03955,
title = {Robust Deep Learning Models Against Semantic-Preserving Adversarial Attack},
author = {Dashan Gao and Yunce Zhao and Yinghua Yao and Zeqi Zhang and Bifei Mao and Xin Yao},
journal= {arXiv preprint arXiv:2304.03955},
year = {2023}
}
备注
Paper accepted by the 2023 International Joint Conference on Neural Networks (IJCNN 2023)