通过自步难类对重加权提高对抗鲁棒性
计算机视觉与模式识别
2022-12-01 v2
摘要
深度神经网络易受对抗攻击。在众多防御策略中,采用无目标攻击的对抗训练是最有效的方法之一。理论上,无目标攻击中的对抗扰动可以沿任意方向添加,并且无目标攻击的预测标签应不可预测。然而,我们发现自然不平衡的类间语义相似性使得那些难类对成为彼此的虚拟目标。本研究探讨了这种紧密耦合的类对对抗攻击的影响,并据此在对抗训练中开发了一种自步重加权策略。具体而言,我们提出在模型优化中提高难类对损失的权重,这促使模型从难类中学习判别性特征。我们进一步在对抗训练中加入了一个量化难类对一致性的项,极大地提升了模型的鲁棒性。大量实验表明,所提出的对抗训练方法在抵御各种对抗攻击时,相比最先进的防御方法取得了更优的鲁棒性表现。
引用
@article{arxiv.2210.15068,
title = {Improving Adversarial Robustness with Self-Paced Hard-Class Pair Reweighting},
author = {Pengyue Hou and Jie Han and Xingyu Li},
journal= {arXiv preprint arXiv:2210.15068},
year = {2022}
}
备注
AAAI-23