中文

最优传输作为对抗攻击的防御手段

机器学习 2021-05-19 v2 计算机视觉与模式识别 机器学习

摘要

如今已知深度学习分类器在其类别的表示上存在缺陷。对抗攻击可为给定图像找到人类难以察觉的扰动,从而误导已训练的模型。对此类攻击最有效的防御方法是在生成的对抗样本上训练以学习其分布。先前工作旨在像域适应一样对齐原始与对抗图像表示以提升鲁棒性。然而,它们使用未反映空间与分布几何的方式部分对齐表示。此外,难以准确比较受防御模型间的鲁棒性。迄今它们使用固定扰动大小进行评估,但受防御模型对该扰动大小的变化可能反应不同。本文将域适应的类比进一步推进,利用最优传输理论。我们提出使用忠实反映地面距离的分布间损失。这带来了 SAT(Sinkhorn 对抗训练),一种对对抗攻击更鲁棒的防御。然后,我们提出使用不同度量——准确率曲线下面积(AUAC)——在更广扰动大小范围内更精确地量化模型对对抗攻击的鲁棒性。我们在 CIFAR-10 与 CIFAR-100 数据集上进行了大量实验,表明我们的防御全局上比最先进水平更鲁棒。

关键词

引用

@article{arxiv.2102.03156,
  title  = {Optimal Transport as a Defense Against Adversarial Attacks},
  author = {Quentin Bouniot and Romaric Audigier and Angélique Loesch},
  journal= {arXiv preprint arXiv:2102.03156},
  year   = {2021}
}

备注

Accepted at ICPR2020. Code is available at https://github.com/CEA-LIST/adv-sat