中文

基于 Scaling Law 与人类对齐研究的对抗鲁棒性极限

机器学习 2024-07-11 v2 密码学与安全 计算机视觉与模式识别

摘要

本文重新审视了使图像分类器对不可感知扰动具有鲁棒性这一简单、长期研究但尚未解决的问题。以 CIFAR10 为例,SOTA 干净准确率约为 100100%,但对 \ell_{\infty}-范数有界扰动的 SOTA 鲁棒性勉强超过 7070%。为了理解这一差距,我们通过开发首个对抗训练的 scaling law,分析了模型大小、数据集大小和合成数据质量如何影响鲁棒性。我们的 scaling law 揭示了现有技术的低效之处,并为推动该领域提供了可操作的反馈。例如,我们发现 SOTA 方法明显偏离了计算最优设置,相对于其鲁棒性水平使用了过多的计算量。利用计算高效设置,我们以更少的训练(推理)FLOPs 超越了先前的 SOTA,训练减少了 2020%(推理减少了 7070%)。我们训练了各种计算高效的模型,其中最佳模型实现了 7474% 的 AutoAttack 准确率(提升 +3+3%)。然而,我们的 scaling law 也预测鲁棒性会缓慢增长然后停滞在 9090%:通过缩放超越我们新的 SOTA 是不切实际的,完美的鲁棒性是不可能的。为了更好地理解这一预测极限,我们在欺骗我们表现最佳模型的 AutoAttack 数据上进行了小规模人类评估。令人担忧的是,我们估计人类的表现也停滞在 9090% 附近,我们表明这归因于 \ell_{\infty} 约束攻击生成了与其原始标签不一致的无效图像。在表征了限制性障碍之后,我们概述了未来研究的有希望的方向。

关键词

引用

@article{arxiv.2404.09349,
  title  = {Adversarial Robustness Limits via Scaling-Law and Human-Alignment Studies},
  author = {Brian R. Bartoldson and James Diffenderfer and Konstantinos Parasyris and Bhavya Kailkhura},
  journal= {arXiv preprint arXiv:2404.09349},
  year   = {2024}
}

备注

ICML 2024