中文

网络相似性与对抗攻击可迁移性之间的关系

密码学与安全 2025-02-03 v1 机器学习

摘要

神经网络易受对抗攻击,且已有多种防御方法被提出。鉴于已开发出大量攻击手段,设计鲁棒网络是一项具有挑战性的任务。因此,我们旨在深入理解网络相似性对迁移对抗攻击成功率的影响。网络设计者可以将其新网络与现有网络进行比较,以评估其脆弱性。为此,我们研究了网络相似性与迁移对抗攻击成功率之间的复杂关系。我们采用中心核对齐(CKA)网络相似性评分,并使用多种方法寻找大量卷积神经网络(CNN)与对抗攻击之间的相关性。研究发现,不同CNN架构之间的网络相似性中等,而更复杂的模型(如DenseNet)因其架构复杂性而表现出较低的相似性得分。层相似性在一致的基础层(如DataParallel、Dropout和Conv2d)中最高,而专用层则表现出更大的变异性。非迁移攻击的成功率通常一致,但某些迁移攻击的成功率差异显著,复杂网络更易受攻击。我们发现,决策树回归器可以预测所有黑盒攻击和Carlini & Wagner攻击的迁移成功率,准确率超过90%,这表明在某些条件下预测模型是可行的。然而,不同数据子集上结果的变异性凸显了这些关系的复杂性,并表明需要进一步研究以将这些发现推广到不同的攻击场景和网络架构。

关键词

引用

@article{arxiv.2501.18629,
  title  = {The Relationship Between Network Similarity and Transferability of Adversarial Attacks},
  author = {Gerrit Klause and Niklas Bunzel},
  journal= {arXiv preprint arXiv:2501.18629},
  year   = {2025}
}