中文

民主训练对抗通用对抗性扰动

机器学习 2025-02-11 v1

摘要

尽管取得了显著的进展和成功,现实中的深度神经网络仍然容易受到对抗性攻击的威胁。通用对抗性扰动(Universal Adversarial Perturbation)作为一种无输入依赖的攻击方式,构成了在安全敏感系统中部署深度神经网络的严重威胁。此时,单个通用对抗性扰动无需针对特定输入进行优化,即可对多种干净输入进行误导,这使其尤其危险。本文发现,通用对抗性扰动通常导致隐藏层中熵谱的异常,表明在此类情况下,预测由少数“特征”主导(而非由众多特征民主化支配)。基于此,我们提出了一种高效且有效的防御方法,称为“民主训练”(Democratic Training),通过基于熵的模型增强来抑制给定模型中的通用对抗性扰动效应。“民主训练”在5个基准数据集上训练的7个神经网络以及5种最先进的通用对抗性攻击方法上进行了评估。结果表明,它有效降低了攻击成功率,提高了模型的鲁棒性,同时保持了在干净样本上的模型准确率。

关键词

引用

@article{arxiv.2502.05542,
  title  = {Democratic Training Against Universal Adversarial Perturbations},
  author = {Bing Sun and Jun Sun and Wei Zhao},
  journal= {arXiv preprint arXiv:2502.05542},
  year   = {2025}
}