对抗训练对基于不变性对抗样本的影响
机器学习
2023-09-19 v1 人工智能
摘要
对抗样本是精心构造的攻击点,旨在欺骗机器学习分类器。近年来,对抗机器学习领域,尤其是基于扰动的对抗样本(即向图像添加人类不可感知的扰动)的研究已被广泛探讨。对抗训练可用于实现对此类输入的鲁棒性。另一类对抗样本是基于不变性的对抗样本,其中图像被语义修改,使得模型预测类别不变,但人类判定的类别发生改变。如何确保对此类对抗样本的鲁棒性尚未被探索。本文研究使用基于不变性的对抗样本进行对抗训练对卷积神经网络(CNN)的影响。我们表明,当应用基于不变性与基于扰动的对抗样本进行对抗训练时,应同时而非依次进行。该过程可实现对两类对抗样本相对较高的鲁棒性。此外,我们发现先前工作中用于生成基于不变性对抗样本的算法未能正确确定标签,因此我们使用人工确定的标签。
引用
@article{arxiv.2302.08257,
title = {On the Effect of Adversarial Training Against Invariance-based Adversarial Examples},
author = {Roland Rauter and Martin Nocker and Florian Merkle and Pascal Schöttle},
journal= {arXiv preprint arXiv:2302.08257},
year = {2023}
}