中文

利用 DeepFool 算法定制深度神经网络上的针对性类别操纵对抗攻击

计算机视觉与模式识别 2025-04-15 v5 人工智能 机器学习

摘要

深度神经网络 (DNNs) 对对抗攻击的易感性削弱了它们在众多应用中的可靠性,凸显了深入探究这些漏洞并制定鲁棒防御策略的必要性。Moosavi-Dezfooli 等人 (2016) 的 DeepFool 算法在识别诱导输入图像误分类所需的最小扰动方面代表了一个关键步骤。然而,其通用方法在需要针对性干预的场景中表现不足。此外,以往研究主要关注攻击成功率,未能充分处理图像随之产生的失真、图像质量的保持或误分类所需置信度阈值。为弥补这些差距,我们引入增强型针对性 DeepFool (ET DeepFool) 算法,它是 DeepFool 的演进版本,不仅支持指定期望的误分类目标,还引入了可配置的最小置信度分数。我们的实证研究表明,这种精炼方法在保持图像完整性和最小化跨多种 DNN 架构扰动方面具有优越性。与以往版本(如 Gajjar 等人 (2022) 的 Targeted DeepFool)不同,我们的方法对扰动过程提供了无与伦比的控制,能够精确操纵模型响应。初步结果显示,包括 AlexNet 和先进的 Vision Transformer 在内的某些模型对此类操纵表现出值得称道的鲁棒性。我们通过置信度水平调整所揭示的模型鲁棒性差异,可能对图像识别领域产生深远影响。我们的代码见 https://github.com/FazleLabib/et_deepfool。

关键词

引用

@article{arxiv.2310.13019,
  title  = {Tailoring Adversarial Attacks on Deep Neural Networks for Targeted Class Manipulation Using DeepFool Algorithm},
  author = {S. M. Fazle Rabby Labib and Joyanta Jyoti Mondal and Meem Arafat Manab and Xi Xiao and Sarfaraz Newaz},
  journal= {arXiv preprint arXiv:2310.13019},
  year   = {2025}
}

备注

18 pages, 5 figures. Accepted by Nature Scientific Reports