中文

对抗训练的新范式:通过虚拟类别释放精度-鲁棒性权衡

机器学习 2025-05-28 v2

摘要

对抗训练(AT)是增强深度神经网络(DNN)鲁棒性的最有效方法之一。然而,现有的AT方法存在固有的精度-鲁棒性权衡。先前的工作在当前AT范式下研究了此问题,但与PGD-AT等简单基线相比,仍面临超过10%的精度下降,且没有显著的鲁棒性提升。这种固有的权衡引发了一个问题:当前假设学习对应的良性样本和对抗样本为同一类别的AT范式,是否不恰当地混合了可能本质上不一致的干净目标和鲁棒目标?事实上,我们的实验结果表明,在多种AT方法和鲁棒模型中,高达40%的CIFAR-10对抗样本始终无法满足这一假设,明确表明了当前AT范式存在改进空间。为了放松这种过于严格的假设以及干净学习和鲁棒学习之间的张力,本文提出了一种新的AT范式,通过为每个原始类别引入一个额外的虚拟类别,旨在容纳扰动后分布发生偏移的困难对抗样本。针对这些对抗样本的鲁棒性可以通过运行时将预测的虚拟类别恢复为相应的原始类别来实现,而不会与良性样本精度的干净目标冲突。最后,基于我们的新范式,我们提出了一种新颖的基于虚拟类别的对抗训练(DUCAT)方法,该方法以即插即用的方式同时提高了精度和鲁棒性,仅涉及logits、损失以及提出的双热软标签监督信号。我们的方法优于最先进的(SOTA)基准,有效释放了当前的权衡。代码可在 https://github.com/FlaAI/DUCAT 获取。

关键词

引用

@article{arxiv.2410.12671,
  title  = {New Paradigm of Adversarial Training: Releasing Accuracy-Robustness Trade-Off via Dummy Class},
  author = {Yanyun Wang and Li Liu and Zi Liang and Yi R. and Fung and Qingqing Ye and Haibo Hu},
  journal= {arXiv preprint arXiv:2410.12671},
  year   = {2025}
}

备注

Preprint. Under review