通过逆向知识蒸馏提升对抗样本的迁移性
机器学习
2025-02-25 v1 人工智能
计算机视觉与模式识别
摘要
近年来,深度神经网络的快速发展使人们越来越关注这些模型的安全性和鲁棒性。虽然现有的对抗攻击算法在提升对抗迁移性方面取得了成功,但由于缺乏对目标模型与源模型之间差异的考虑,其性能仍不理想。为了解决这一局限性,我们提出了一种新方法 Inverse Knowledge Distillation (IKD),旨在有效增强对抗迁移性。IKD 引入了一个受蒸馏启发的损失函数,该函数与基于梯度的攻击方法无缝集成,促进了攻击梯度的多样性并缓解了对特定模型架构的过拟合。通过使梯度多样化,IKD 能够生成具有跨不同模型卓越泛化能力的对抗样本,显著增强了它们在黑盒攻击场景中的有效性。在 ImageNet 数据集上的大量实验验证了我们方法的有效性,表明在广泛模型范围内对抗样本的迁移性和攻击成功率均有显著提升。
引用
@article{arxiv.2502.17003,
title = {Improving the Transferability of Adversarial Examples by Inverse Knowledge Distillation},
author = {Wenyuan Wu and Zheng Liu and Yong Chen and Chao Su and Dezhong Peng and Xu Wang},
journal= {arXiv preprint arXiv:2502.17003},
year = {2025}
}