中文

基于集成渐近正态分布学习的强可迁移对抗攻击

机器学习 2024-04-01 v2 计算机视觉与模式识别

摘要

强对抗样本对于评估和增强深度神经网络的鲁棒性至关重要。然而,主流攻击方法的性能通常较为敏感,例如对微小的图像变换敏感,其根源在于有限的信息——通常仅有一个输入样本、少量白盒源模型和未定义的防御策略。因此,所构造的对抗样本容易过拟合源模型,这阻碍了它们向未知架构的可迁移性。本文提出一种名为多重渐近正态分布攻击(MultiANDA)的方法,该方法从学习到的分布中显式刻画对抗扰动。具体而言,我们利用随机梯度上升(SGA)的渐近正态性来近似扰动上的后验分布,随后采用深度集成策略作为该过程中贝叶斯边缘化的有效代理,旨在估计一个高斯混合分布,从而更彻底地探索潜在的优化空间。所近似的后验本质上描述了SGA迭代的平稳分布,其捕获了局部最优点周围的几何信息。因此,MultiANDA允许为每个输入抽取无限数量的对抗扰动,并可靠地保持可迁移性。我们通过在七个正常训练和七个防御模型上的大量实验表明,所提方法在有无防御的深度学习模型上均优于十种最先进的黑盒攻击。

关键词

引用

@article{arxiv.2209.11964,
  title  = {Strong Transferable Adversarial Attacks via Ensembled Asymptotically Normal Distribution Learning},
  author = {Zhengwei Fang and Rui Wang and Tao Huang and Liping Jing},
  journal= {arXiv preprint arXiv:2209.11964},
  year   = {2024}
}