以敌之敌为友:探索逆对抗样本以改进对抗训练
计算机视觉与模式识别
2022-11-02 v1 机器学习
摘要
尽管当前的深度学习技术在各种计算机视觉任务上取得了优越性能,但它们仍易受对抗样本的攻击。对抗训练及其变体已被证明是防御对抗样本最有效的方法。这些方法通常正则化对抗样本与其对应自然样本的输出概率之间的差异。然而,若模型误分类了自然样本,这可能会产生负面影响。为规避此问题,我们提出了一种新颖的对抗训练方案,鼓励模型对对抗样本及其“逆对抗”对应样本产生相似输出。这些样本被生成以在自然样本邻域内最大化似然。在各种视觉数据集和架构上的大量实验表明,我们的训练方法实现了最先进的鲁棒性以及自然精度。此外,利用逆对抗样本的通用版本,我们以较低计算成本改进了单步对抗训练技术的性能。
引用
@article{arxiv.2211.00525,
title = {The Enemy of My Enemy is My Friend: Exploring Inverse Adversaries for Improving Adversarial Training},
author = {Junhao Dong and Seyed-Mohsen Moosavi-Dezfooli and Jianhuang Lai and Xiaohua Xie},
journal= {arXiv preprint arXiv:2211.00525},
year = {2022}
}