中文

用于鲁棒且可泛化防御的插值联合空间对抗训练

计算机视觉与模式识别 2023-12-04 v1 密码学与安全

摘要

对抗训练(AT)被认为是抵御对抗攻击最可靠的防御手段之一。然而,以 AT 训练的模型牺牲了标准准确率,且不能很好地泛化到新颖攻击。近期工作表明,在如流形上威胁模型或神经感知威胁模型等新颖威胁模型下的对抗样本可改善泛化。但前者需要精确的流形信息,而后者需要算法松弛。受这些考量驱动,我们利用 Normalizing Flow 挖掘底层流形信息,确保精确流形假设成立。此外,我们提出一种称为联合空间威胁模型(JSTM)的新威胁模型,它可作为神经感知威胁模型的特例,且无需额外松弛即可构造相应对抗攻击。在 JSTM 下,我们开发了新颖的对抗攻击与防御。mixup 策略提升了神经网络的标准准确率,但与 AT 结合时牺牲了鲁棒性。为解决此问题,我们提出 Robust Mixup 策略,其中我们最大化插值图像的对抗性,从而获得鲁棒性并防止过拟合。我们的实验表明,插值联合空间对抗训练(IJSAT)在 CIFAR-10/100、OM-ImageNet 和 CIFAR-10-C 数据集上于标准准确率、鲁棒性和泛化性方面均取得良好表现。IJSAT 亦具灵活性,可用作数据增强方法以提升标准准确率,并与许多现有 AT 方法结合以改善鲁棒性。

关键词

引用

@article{arxiv.2112.06323,
  title  = {Interpolated Joint Space Adversarial Training for Robust and Generalizable Defenses},
  author = {Chun Pong Lau and Jiang Liu and Hossein Souri and Wei-An Lin and Soheil Feizi and Rama Chellappa},
  journal= {arXiv preprint arXiv:2112.06323},
  year   = {2023}
}

备注

Under submission