利用特征可分离性增强对抗训练
计算机视觉与模式识别
2022-05-03 v1 人工智能
摘要
深度神经网络(DNN)易受对抗攻击。作为一种对策,对抗训练旨在基于极小极大优化问题实现鲁棒性,已被证明是最有效的防御策略之一。然而,本工作中我们发现,与自然训练相比,对抗训练未能为干净样本或对抗体本学习更好的特征表示,这可能是对抗训练往往存在严重过拟合问题且泛化性能不尽如人意的一个原因。具体而言,我们观察到现有对抗训练方法所学特征的两个主要缺陷:(1) 类内特征相似度低;(2) 类间特征方差保守。为克服这些缺陷,我们引入了对抗训练图(ATG)的新概念,借助该图所提出的特征可分离性对抗训练(ATFS)能够协同提升类内特征相似度并增大类间特征方差。通过综合实验,我们证明了所提 ATFS 框架显著提升了干净与鲁棒性能。
引用
@article{arxiv.2205.00637,
title = {Enhancing Adversarial Training with Feature Separability},
author = {Yaxin Li and Xiaorui Liu and Han Xu and Wentao Wang and Jiliang Tang},
journal= {arXiv preprint arXiv:2205.00637},
year = {2022}
}
备注
10 pages