中文

有限高斯神经元:通过让神经网络说“我不知道”来抵御对抗攻击

机器学习 2023-06-14 v1 密码学与安全

摘要

自 2014 年以来,人工神经网络已知易受对抗攻击,攻击者对输入做出人眼难以察觉的改动,即可欺骗网络产生错误或荒谬的输出。尽管已提出针对对抗攻击的防御方法,但它们通常涉及从头重新训练一个新的神经网络,这是一项代价高昂的任务。在这项工作中,我引入了有限高斯神经元(FGN),一种用于人工神经网络的新型神经元架构。我的工作旨在:—轻松将现有模型转换为有限高斯神经元架构,—同时在真实数据上保持现有模型的行为,—并提供对对抗攻击的抵抗力。我表明,与经典神经网络相比,转换并重新训练的有限高斯神经网络(FGNN)在随机化和快速梯度符号法对抗图像上的预测置信度始终更低(即不过度自信),同时在真实 MNIST 图像上保持高准确率和置信度。为了进一步验证有限高斯神经元抵御对抗攻击的能力,我将 FGN 的行为与贝叶斯神经网络在随机和对抗图像下的行为进行比较,并展示两种架构行为的差异。最后,我通过在更复杂的 SPEECHCOMMANDS 任务上测试 FGN 模型,并针对更强的 Carlini-Wagner 和投影梯度下降对抗攻击,展示了 FGN 模型的一些局限性。

关键词

引用

@article{arxiv.2306.07796,
  title  = {Finite Gaussian Neurons: Defending against adversarial attacks by making neural networks say "I don't know"},
  author = {Felix Grezes},
  journal= {arXiv preprint arXiv:2306.07796},
  year   = {2023}
}

备注

PhD thesis