Dummy-Aware Weighted Attack(DAWA):打破 Dummy Class 防御中的安全沉箱
机器学习
2026-04-01 v1 密码学与安全
摘要
对抗鲁棒性评估面临关键挑战,因为新兴的防御范式会利用现有评估方法的局限性。本文揭示了基于 Dummy Class 的防御引入额外“哑元”类作为对抗样本的安全沉箱,在常规评估策略如 AutoAttack 下会显著高估其鲁棒性。根本局限性在于,这些攻击仅聚焦于误导真实类别标签,这与防御机制完美一致——成功的攻击被简化地归入哑元类。为解决这一问题,本文提出 Dummy-Aware Weighted Attack(DAWA),即一种同时针对真实标签和哑元标签并采用自适应加权进行对抗样本生成的新型评估方法。大量实验表明,DAWA 有效突破了该防御范式,在 CIFAR-10 上 l_infty 扰动(epsilon=8/255)下的鲁棒性从 58.61% 降至 29.52%。我们的工作为评估这类新兴防御提供了更可靠的基准,并凸显了鲁棒性评估方法持续演进的必要性。
引用
@article{arxiv.2603.29182,
title = {Dummy-Aware Weighted Attack (DAWA): Breaking the Safe Sink in Dummy Class Defenses},
author = {Yunrui Yu and Xuxiang Feng and Pengda Qin and Pengyang Wang and Kafeng Wang and Cheng-zhong Xu and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2603.29182},
year = {2026}
}