面向百万级对抗鲁棒性评估的更强单样本攻击
机器学习
2025-03-12 v4 人工智能
密码学与安全
计算机视觉与模式识别
摘要
随着深度学习模型在安全关键型应用中的部署增多,评估其对对抗扰动的脆弱性对于确保其可靠性和可信赖性至关重要。过去十年间,提出了大量白盒对抗鲁棒性评估方法(即攻击),从单步到多步,从单样本到集成方法。尽管取得了这些进展,在进行有意义且全面的鲁棒性评估时,特别是大规模测试和确保评估反映真实世界对抗风险方面仍面临挑战。本文聚焦图像分类模型,提出一种新型单样本攻击方法——概率边际攻击(Probability Margin Attack, PMA),该方法在概率空间而非logits空间定义对抗边际。我们分析了PMA与现有基于交叉熵或logits边际的攻击之间的关系,表明PMA能超过当前最先进的单样本方法。基于PMA,我们提出两种类型的集成攻击,在有效性和效率之间取得平衡。进一步地,我们创建了一个来自现有CC3M数据集的百万级数据集CC1M,并用于对抗训练的ImageNet模型进行首次百万级白盒对抗鲁棒性评估。我们的发现为单样本攻击与集成攻击之间的鲁棒性差异以及小规模评估与百万级评估之间的差异提供了宝贵见解。
引用
@article{arxiv.2411.15210,
title = {Towards Million-Scale Adversarial Robustness Evaluation With Stronger Individual Attacks},
author = {Yong Xie and Weijie Zheng and Hanxun Huang and Guangnan Ye and Xingjun Ma},
journal= {arXiv preprint arXiv:2411.15210},
year = {2025}
}