中文

以扰动对抗扰动:基于神经元影响的对抗攻击防御

计算机视觉与模式识别 2024-08-21 v3 人工智能 密码学与安全

摘要

深度学习模型面对对抗攻击时的脆弱性已引起越来越多的关注,尤其在模型部署于安全关键领域时。大量防御方法,包括反应式与主动式,已被提出以提升模型鲁棒性。反应式防御(如通过变换去除扰动)通常难以处理大扰动;涉及重训练的主动式防御则受限于攻击依赖性与高计算成本。本文从对抗攻击对模型内部神经元的一般影响出发考虑防御方法。我们引入神经元影响的概念,可定量度量神经元对正确分类的贡献。随后我们观察到,几乎所有攻击均通过抑制影响较大神经元并增强影响较小神经元来欺骗模型。基于此,我们提出一种针对通用对抗攻击的新型防御方法——神经元级逆扰动(NIP)。它从良性样本计算神经元影响,进而通过生成逆扰动修改输入样本,从而反过来增强影响较大神经元并削弱影响较小神经元。

关键词

引用

@article{arxiv.2112.13060,
  title  = {Fight Perturbations with Perturbations: Defending Adversarial Attacks via Neuron Influence},
  author = {Ruoxi Chen and Haibo Jin and Haibin Zheng and Jinyin Chen and Zhenguang Liu},
  journal= {arXiv preprint arXiv:2112.13060},
  year   = {2024}
}

备注

Final version. Accepted to IEEE Transactions on Dependable and Secure Computing