中文

具有对抗攻击结构抗性的神经网络

机器学习 2018-09-26 v1 密码学与安全 机器学习 神经与进化计算

摘要

在对机器学习分类器的对抗攻击中,会向正确分类的输入添加微小扰动。这些扰动产生对抗样本,其与原输入几乎无法区分,却被错误分类。在用于深度学习的标凖神经网络中,攻击者可对大多数输入构造对抗样本以引发其选定的错误分类。我们引入一种新型网络单元,称为 RBFI 单元,其非线性结构使其天然抵抗对抗攻击。在置换不变的 MNIST 上,无对抗攻击时,使用 RBFI 单元的网络与使用 sigmoid 单元的网络性能相当,且略低于使用 ReLU 单元的网络准确率。遭受对抗攻击时,带 RBFI 单元的网络在使 ReLU 或 sigmoid 单元网络准确率降至 2% 以下的攻击下仍保持 90% 以上的准确率。仅用常规输入训练的 RBFI 网络,其对抗攻击抗性甚至优于借助对抗样本训练的 ReLU 与 sigmoid 网络。RBFI 单元的非线性结构使其难以用标准梯度下降训练。我们展示,使用伪梯度(由特别设计以促进学习而非其真实导数的函数计算而得)可高效训练 RBFI 单元网络至高精度。我们表明伪梯度的使用使深度 RBFI 网络的训练切实可行,并比较了若干 RBFI 网络结构变体在准确率上的差异。

关键词

引用

@article{arxiv.1809.09262,
  title  = {Neural Networks with Structural Resistance to Adversarial Attacks},
  author = {Luca de Alfaro},
  journal= {arXiv preprint arXiv:1809.09262},
  year   = {2018}
}