中文

面向强鲁棒性评估的黑箱对抗攻击基准:RobustBlack

机器学习 2026-02-18 v2

摘要

尽管对抗鲁棒性在白盒设置中得到了广泛研究,但近期发展的黑箱攻击(包括迁移和查询方法)主要针对弱鲁棒模型进行基准测试,导致其对更近期和中等程度鲁棒模型(如Robustbench板块中展示的模型)有效性评估存在显著缺口。本文质疑这种对黑箱攻击针对鲁棒模型的关注不足。我们建立了一个框架,用于评估最新黑箱攻击在ImageNet数据集上针对顶级防御机制和标准防御机制的有效性。我们的实证评估揭示了以下关键发现:(1)最先进的黑箱攻击即使针对简单对抗训练模型也难以成功;(2)针对强白盒攻击(如AutoAttack)优化的鲁棒模型也表现出增强的抗黑箱攻击鲁棒性;(3)代理模型与目标模型之间的鲁棒性对齐是迁移基于攻击成功率的关键因素。

关键词

引用

@article{arxiv.2412.20987,
  title  = {RobustBlack: Challenging Black-Box Adversarial Attacks on State-of-the-Art Defenses},
  author = {Mohamed Djilani and Salah Ghamizi and Maxime Cordy},
  journal= {arXiv preprint arXiv:2412.20987},
  year   = {2026}
}