中文

标签平滑与对抗鲁棒性

计算机视觉与模式识别 2020-09-18 v1

摘要

近期研究表明,当前的对抗攻击方法存在缺陷,在遇到某些刻意设计的防御时容易失效。有时即便模型细节上的微小改动也会使攻击无效。我们发现,使用标签平滑训练模型可以轻易地在大多数基于梯度的攻击下取得惊人的准确率。例如,在CIFAR-10上用标签平滑训练的WideResNet模型在PGD攻击下最高可达到75%的鲁棒准确率。为了理解这种微妙鲁棒性背后的原因,我们研究了标签平滑与对抗鲁棒性之间的关系。通过对使用标签平滑训练的网络特征进行理论分析,并验证其在各类攻击下的性能,我们基于其防御效果不稳定且无法防御从自然训练模型迁移而来的攻击这一事实,证明标签平滑产生的鲁棒性是不完整的。我们的研究启示学界重新思考如何恰当地评估模型的鲁棒性。

关键词

引用

@article{arxiv.2009.08233,
  title  = {Label Smoothing and Adversarial Robustness},
  author = {Chaohao Fu and Hongbin Chen and Na Ruan and Weijia Jia},
  journal= {arXiv preprint arXiv:2009.08233},
  year   = {2020}
}