中文

DAFAR:基于反馈自编码器重构的对抗防御方法

计算机视觉与模式识别 2021-03-18 v2 人工智能 密码学与安全

摘要

深度学习在具有挑战性的感知任务上展现出令人印象深刻的性能,并已被广泛用于软件中以提供智能服务。然而,研究者发现深度神经网络易受对抗样本攻击。此后,许多方法被提出以防御输入中的对抗样本,但它们要么依赖于特定攻击,要么被证明对新攻击无效。并且大多数现有技术具有复杂的结构或机制,导致过高的开销或延迟,难以在真实软件中应用。我们提出 DAFAR,一种反馈框架,使深度学习模型能以高效性与通用性检测/净化对抗样本,且面积与时间开销低。DAFAR 结构简洁,包含一个受害模型、一个插件式反馈网络与一个检测器。其核心思想是将受害模型特征提取层的高层特征导入反馈网络以重构输入。该数据流构成一个反馈自编码器。对于强攻击,它将受害模型上难以察觉的攻击直接转化为反馈自编码器上明显的重构误差攻击,更易检测;对于弱攻击,重构过程破坏了对抗样本的结构。在 MNIST 与 CIFAR-10 数据集上的实验表明,DAFAR 能有效抵御流行且可称最先进的攻击,且不损失在合法样本上的性能,在跨攻击方法与参数上具有高效性与通用性。

关键词

引用

@article{arxiv.2103.06487,
  title  = {DAFAR: Defending against Adversaries by Feedback-Autoencoder Reconstruction},
  author = {Haowen Liu and Ping Yi and Hsiao-Ying Lin and Jie Shi and Weidong Qiu},
  journal= {arXiv preprint arXiv:2103.06487},
  year   = {2021}
}