MALT 提升对抗性攻击性能
机器学习
2024-07-03 v1 密码学与安全
神经与进化计算
机器学习
摘要
当前针对多类分类器的对抗性攻击会针对给定输入的目标类别进行盲目选择,基于分类器对各种目标类别的置信水平。我们提出了一种新型对抗性定向方法,\textit{MALT - Mesoscopic Almost Linearity Targeting},基于中等规模的近似线性性假设。我们的攻击在标准基准数据集 CIFAR-100 和 ImageNet 上超过当前最先进的 AutoAttack,并针对各种鲁棒模型取得优异成绩。特别是,我们的攻击比 AutoAttack 快 \emph{五倍},成功匹配所有 AutoAttack 的成功案例,并攻击了之前无法触及的额外样本。我们随后形式地证明并通过实证方式表明,尽管该定向方法灵感来自线性预测器,但同样适用于标准非线性模型。
关键词
引用
@article{arxiv.2407.02240,
title = {MALT Powers Up Adversarial Attacks},
author = {Odelia Melamed and Gilad Yehudai and Adi Shamir},
journal= {arXiv preprint arXiv:2407.02240},
year = {2024}
}