用于评估与增强对抗防御的尺度不变对抗攻击
计算机视觉与模式识别
2022-02-01 v1
摘要
高效且有效的攻击对于可靠地评估防御以及开发鲁棒模型至关重要。投影梯度下降(PGD)攻击已被证明是最成功的对抗攻击之一。然而,标准PGD攻击的效果可通过重新缩放logits而被轻易削弱,而每个输入的原始决策并不会改变。为缓解此问题,本文提出尺度不变对抗攻击(SI-PGD),其利用倒数第二层特征与softmax层权重之间的夹角来引导对抗样本的生成。余弦角矩阵用于学习角度判别性表示,且不会随logits的重新缩放而改变,从而使SI-PGD攻击稳定且有效。我们针对多种防御评估了所提攻击,并与现有攻击相比展现出更优性能。进一步,我们提出基于余弦角矩阵的尺度不变(SI)对抗防御机制,其可嵌入到流行的对抗防御中。实验结果表明,采用我们SI机制的防御方法在多步与单步防御中均达到了最先进的性能。
引用
@article{arxiv.2201.12527,
title = {Scale-Invariant Adversarial Attack for Evaluating and Enhancing Adversarial Defenses},
author = {Mengting Xu and Tao Zhang and Zhongnian Li and Daoqiang Zhang},
journal= {arXiv preprint arXiv:2201.12527},
year = {2022}
}
备注
TDSC under review