通过对抗权重调优增强对抗迁移性
密码学与安全
2025-10-21 v4
摘要
深度神经网络(DNN)容易受到对抗样本(AE)的攻击,这些样本在人类观察者看来无害却会误导模型。对抗样本的迁移性是一个关键问题,它使得无需直接访问目标模型即可实施黑盒攻击。然而,许多先前攻击未能解释对抗迁移性的内在机制。在本文中,我们重新思考可迁移对抗样本的性质,并重新表述了迁移性的公式。基于对这一机制的洞察,我们分析了不同架构模型之间对抗样本的泛化性,并证明我们可以找到一个局部扰动来缩小替代模型与目标模型之间的差距。我们进一步建立了模型平滑性与平坦局部极大值之间的内在联系,两者均有助于对抗样本的迁移性。此外,我们提出了一种新的对抗攻击算法——对抗权重调优(AWT),它利用生成的对抗样本自适应地调整替代模型的参数,以同时优化平坦局部极大值和模型平滑性,无需额外数据。AWT是一种无数据调优方法,结合了基于梯度和基于模型的攻击方法来增强对抗样本的迁移性。在ImageNet上对多种不同架构模型的广泛实验表明,AWT相较于其他攻击取得了优越性能,在基于CNN的模型和基于Transformer的模型上攻击成功率分别平均提升了近5%和10%。代码可在 https://github.com/xaddwell/AWT 获取。
引用
@article{arxiv.2408.09469,
title = {Enhancing Adversarial Transferability with Adversarial Weight Tuning},
author = {Jiahao Chen and Zhou Feng and Rui Zeng and Yuwen Pu and Chunyi Zhou and Yi Jiang and Yuyou Gan and Jinbao Li and Shouling Ji},
journal= {arXiv preprint arXiv:2408.09469},
year = {2025}
}
备注
Accepted by AAAI 2025. Code available at https://github.com/xaddwell/AWT