通过输入转置提高对抗攻击可迁移性
计算机视觉与模式识别
2025-03-04 v1 人工智能
密码学与安全
机器学习
摘要
深度神经网络(DNNs)高度易受到对抗样本的影响,这些样本是施加于输入上的细微扰动,常对人类而言是肉眼难以察觉的,但却导致模型预测错误。在黑箱场景中,现有的对抗样本表现出有限的可迁移性,难以有效地针对多个不可见的 DNN 模型造成损害。以往的策略通过引入扰动的多样性来增强对抗样本的跨模型泛化,从而提高可迁移性。然而,进一步细化扰动的多样性往往需要复杂的算法开发和大量计算消耗。在本工作中,我们提出了一种输入转置方法,该方法几乎不需要额外的劳动和计算成本,却能显著提高现有对抗策略的可迁移性。即使不添加对抗扰动,我们的方法在跨模型攻击方面也显示出相当大的效果。我们的探索发现,在特定数据集上,仅仅 的左转或右转旋转可能就足以让大多数对抗样本欺骗未见的模型。我们的进一步分析表明,仅通过旋转 所导致的可迁移性改善可能源于 DNN 低层特征图中可见模式的偏移。此外,这种可迁移性 exhibits optimal angles that, when identified under unrestricted query conditions, could potentially yield even greater performance.
引用
@article{arxiv.2503.00932,
title = {Improving the Transferability of Adversarial Attacks by an Input Transpose},
author = {Qing Wan and Shilong Deng and Xun Wang},
journal= {arXiv preprint arXiv:2503.00932},
year = {2025}
}
备注
15 pages, 11 figures