中文

学习防御变换器以反击对抗样本

机器学习 2021-03-16 v1 密码学与安全

摘要

深度神经网络(DNNs)易受带有微小扰动的对抗样本的攻击。因此,对抗防御已成为通过抵御对抗样本来提升 DNNs 鲁棒性的重要手段。现有防御方法聚焦于某些特定类型的对抗样本,在真实应用场景中可能难以良好防御。在实践中,我们可能面临多种类型的攻击,且真实应用中对抗样本的确切类型甚至未知。本文中,受对抗样本更可能出现在分类边界附近的启发,我们从一新视角研究对抗样本:能否通过将对抗样本拉回原始干净分布来防御它们。我们从理论和实验上验证了可恢复对抗样本的防御仿射变换的存在性。基于此,我们通过参数化仿射变换并利用 DNNs 的边界信息,学习了一个防御变换器(defense transformer)来反击对抗样本。在玩具和真实世界数据集上的大量实验证明了我们防御变换器的有效性与泛化能力。

关键词

引用

@article{arxiv.2103.07595,
  title  = {Learning Defense Transformers for Counterattacking Adversarial Examples},
  author = {Jincheng Li and Jiezhang Cao and Yifan Zhang and Jian Chen and Mingkui Tan},
  journal= {arXiv preprint arXiv:2103.07595},
  year   = {2021}
}