基于微生物遗传算法的可解释深度学习系统黑盒攻击
计算机视觉与模式识别
2023-07-14 v1 人工智能
密码学与安全
机器学习
摘要
深度学习模型在白盒与黑盒环境中都易受对抗样本攻击。尽管先前研究已展示出高攻击成功率,但当有人类专家参与时,将 DNN 模型与解释模型结合可在一定程度上提供安全感,专家能够辨别给定样本是良性还是恶意。然而,在白盒环境中,可解释深度学习系统(IDLSes)已被证明易受恶意操控。在黑盒设定下,由于对 IDLSes 各组件的访问受限,攻击者欺骗系统变得更具挑战性。在这项工作中,我们提出一种针对 IDLSes 的基于查询高效的分数黑盒攻击 QuScore,它不需要目标模型及其耦合解释模型的任何知识。QuScore 基于迁移式与分数式方法,采用一种有效的微生物遗传算法。我们的方法旨在减少成功攻击所需的查询次数,从而实现更高效的过程。通过基于 IDLS 的反馈分数持续精炼所生成的对抗样本,我们的方法有效搜索空间以识别能欺骗系统的扰动。我们在四个 CNN 模型(Inception、ResNet、VGG、DenseNet)与两个解释模型(CAM、Grad)上评估攻击有效性,使用 ImageNet 与 CIFAR 数据集。我们的结果表明,所提方法查询高效,攻击成功率高,可达 95% 至 100%,并且在 ImageNet 与 CIFAR 数据集中具有平均成功率为 69% 的可迁移性。我们的攻击方法生成的对抗样本其归因图类似于良性样本。我们还证明了我们的攻击能抵御多种预处理防御技术,并可轻易迁移至不同 DNN 模型。
引用
@article{arxiv.2307.06496,
title = {Microbial Genetic Algorithm-based Black-box Attack against Interpretable Deep Learning Systems},
author = {Eldor Abdukhamidov and Mohammed Abuhamad and Simon S. Woo and Eric Chan-Tin and Tamer Abuhmed},
journal= {arXiv preprint arXiv:2307.06496},
year = {2023}
}