中文

对抗攻击的坡度是多少?将对抗攻击与扰动鲁棒性联系起来

机器学习 2026-01-27 v2 人工智能

摘要

对抗攻击被广泛用于识别模型漏洞;然而,他们作为鲁棒性对随机扰动的代理 validity 仍受争议。我们询问,对抗示例是否提供了对相同规模随机扰动下误预测风险的代表性估计,还是反映了至少异乎寻常的极端事件。为回答此问题,我们引入一种概率分析,通过量化该风险相对于方向性偏置扰动分布的影响,该分布由浓度因子 κ\kappa 参数化,κ\kappa 在各向同性噪声和对抗方向之间插值。建立在此基础上,我们研究了这种连接的极限,通过提出一种攻击策略来探测在统计上更接近均匀噪声的情形下的漏洞。在 ImageNet 和 CIFAR-10 上的系统性基准测试多个攻击,揭示了当对抗成功在多大程度上真正反映对扰动的鲁棒性以及何时不反映这种情况,从而为其在安全导向鲁棒性评估中使用提供指导。

关键词

引用

@article{arxiv.2601.14519,
  title  = {How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness},
  author = {Giulio Rossolini},
  journal= {arXiv preprint arXiv:2601.14519},
  year   = {2026}
}