中文

保语义对抗训练

机器学习 2020-09-24 v1 计算机视觉与模式识别 机器学习

摘要

对抗训练是一种防御技术,通过在与训练数据中纳入对抗样本来提高深度神经网络(DNN)的对抗鲁棒性。在本文中,我们指出了对抗训练中被忽视的一个问题:这些对抗样本往往与原始数据具有不同的语义,给模型引入了非预期的偏置。我们假设此类非保语义(并因此模糊的)对抗数据会损害目标模型的鲁棒性。为缓解对抗样本的这种非预期语义变化,我们提出保语义对抗训练(SPAT),其在训练阶段生成对抗样本时鼓励对所有类别共享的像素进行扰动。实验结果表明,SPAT提高了对抗鲁棒性,并在CIFAR-10和CIFAR-100上取得了最先进的结果。

关键词

引用

@article{arxiv.2009.10978,
  title  = {Semantics-Preserving Adversarial Training},
  author = {Wonseok Lee and Hanbit Lee and Sang-goo Lee},
  journal= {arXiv preprint arXiv:2009.10978},
  year   = {2020}
}

备注

Preprint. Under Review