中文

面向对抗攻击的动态标签对抗训练

机器学习 2024-08-26 v1 计算机视觉与模式识别

摘要

对抗训练是增强模型鲁棒性的最有效方法之一。最近的做法在对抗训练架构中包含对抗蒸馏。然而,我们注意到两种防御方法限制了其性能:(1) 以前的方法主要使用静态 ground truth 进行对抗训练,但这会导致 robust overfit; (2) 损失函数要么是均方误差,要么是 KL 散度,导致对 clean accuracy 的次优表现。为解决这些问题,我们提出了动态标签对抗训练 (DYNAT) 算法,使目标模型能够逐渐且动态地从指导模型的决策中获得鲁棒性。此外,我们发现目标模型内部优化的一个预算维度可能有助于在 clean accuracy 和 robust accuracy 之间进行权衡。因此,我们提出一种新型内部优化方法纳入对抗训练。这将使目标模型能够基于来自指导模型的动态标签自适应搜索对抗样本,从而增强目标模型的鲁棒性。大量实验验证了我们方法的优越性能。

关键词

引用

@article{arxiv.2408.13102,
  title  = {Dynamic Label Adversarial Training for Deep Learning Robustness Against Adversarial Attacks},
  author = {Zhenyu Liu and Haoran Duan and Huizhi Liang and Yang Long and Vaclav Snasel and Guiseppe Nicosia and Rajiv Ranjan and Varun Ojha},
  journal= {arXiv preprint arXiv:2408.13102},
  year   = {2024}
}