中文

基于自监督的在线对抗净化

机器学习 2022-01-02 v1 密码学与安全 计算机视觉与模式识别

摘要

深度神经网络已知易受对抗样本攻击,即输入空间中的微小扰动会导致潜在网络表征的放大偏移。在本文中,我们将规范监督学习与自监督表征学习相结合,提出自监督在线对抗净化(SOAP),一种利用自监督损失在测试时净化对抗样本的新型防御策略。我们的方法借助自监督信号与标签无关的特性,并针对自监督任务抵消对抗扰动。SOAP 在鲁棒准确率上可与最先进的对抗训练与净化方法相媲美,且训练复杂度显著降低。此外,即便攻击者知晓净化防御策略,我们的方法依然鲁棒。据我们所知,本文首次将使用自监督信号执行在线测试时净化的思想推广开来。

关键词

引用

@article{arxiv.2101.09387,
  title  = {Online Adversarial Purification based on Self-Supervision},
  author = {Changhao Shi and Chester Holtz and Gal Mishne},
  journal= {arXiv preprint arXiv:2101.09387},
  year   = {2022}
}

备注

Accepted to ICLR 2021