针对图像识别对抗攻击的通用防御方法
计算机视觉与模式识别
2024-03-14 v1 图像与视频处理
摘要
对抗攻击对图像识别任务构成重大安全风险。在现实环境中防御这些攻击可类比于杀毒软件的工作方式,其中一个关键考量是防御对新攻击和不断演化攻击的适应能力。另一个重要因素是训练防御模型和更新模型数据库所涉及的时间和成本资源。训练许多针对每种攻击类型的特定模型可能耗时且昂贵。理想情况下,我们应能训练一个单一模型来处理广泛的攻击。基于图像到图像转换的防御方法似乎能够实现这一点。本文提出的通用防御方法仅需训练一个模型即可有效抵御各种未知的对抗攻击。训练后的模型成功地将分类准确率从接近零提升至平均86%,优于先前研究中提出的其他防御方法。在面对PGD攻击和MI-FGSM攻击时,通用防御模型甚至优于基于这两种攻击训练的特定攻击模型。鲁棒性检验还表明,无论攻击强度如何,我们的通用防御模型均表现稳定。
引用
@article{arxiv.2403.08170,
title = {Versatile Defense Against Adversarial Attacks on Image Recognition},
author = {Haibo Zhang and Zhihua Yao and Kouichi Sakurai},
journal= {arXiv preprint arXiv:2403.08170},
year = {2024}
}