基于迁移的对抗攻击中模型集成的再思考
计算机视觉与模式识别
2024-03-05 v2
摘要
人们广泛认识到深度学习模型缺乏对对抗样本的鲁棒性。对抗样本一个引人注目的特性是它们可以跨不同模型迁移,这使得在不知情受害者模型的情况下实现黑盒攻击成为可能。一种提升迁移性的有效策略是攻击模型集成。然而,以往工作只是简单地对不同模型的输出取平均,缺乏对模型集成方法如何以及为何能显著增强迁移性的深入分析。本文中,我们重新思考对抗攻击中的集成,并以两个性质定义模型集成的共同弱点:1) 损失景观的平坦性;以及 2) 与每个模型局部最优的接近程度。我们通过实验与理论表明,这两个性质均与迁移性高度相关,并提出一种共同弱点攻击 (CWA),通过促进这两个性质来生成迁移性更强的对抗样本。在图像分类与目标检测任务上的实验结果验证了我们的方法在提升对抗迁移性方面的有效性,尤其在攻击对抗训练模型时。我们还成功将方法应用于攻击黑盒大型视觉-语言模型——Google 的 Bard,展示了实际有效性。代码见 \url{https://github.com/huanranchen/AdversarialAttacks}。
引用
@article{arxiv.2303.09105,
title = {Rethinking Model Ensemble in Transfer-based Adversarial Attacks},
author = {Huanran Chen and Yichi Zhang and Yinpeng Dong and Xiao Yang and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2303.09105},
year = {2024}
}