基于 Scaling Law 与人类对齐研究的对抗鲁棒性极限
机器学习
2024-07-11 v2 密码学与安全
计算机视觉与模式识别
摘要
本文重新审视了使图像分类器对不可感知扰动具有鲁棒性这一简单、长期研究但尚未解决的问题。以 CIFAR10 为例,SOTA 干净准确率约为 %,但对 -范数有界扰动的 SOTA 鲁棒性勉强超过 %。为了理解这一差距,我们通过开发首个对抗训练的 scaling law,分析了模型大小、数据集大小和合成数据质量如何影响鲁棒性。我们的 scaling law 揭示了现有技术的低效之处,并为推动该领域提供了可操作的反馈。例如,我们发现 SOTA 方法明显偏离了计算最优设置,相对于其鲁棒性水平使用了过多的计算量。利用计算高效设置,我们以更少的训练(推理)FLOPs 超越了先前的 SOTA,训练减少了 %(推理减少了 %)。我们训练了各种计算高效的模型,其中最佳模型实现了 % 的 AutoAttack 准确率(提升 %)。然而,我们的 scaling law 也预测鲁棒性会缓慢增长然后停滞在 %:通过缩放超越我们新的 SOTA 是不切实际的,完美的鲁棒性是不可能的。为了更好地理解这一预测极限,我们在欺骗我们表现最佳模型的 AutoAttack 数据上进行了小规模人类评估。令人担忧的是,我们估计人类的表现也停滞在 % 附近,我们表明这归因于 约束攻击生成了与其原始标签不一致的无效图像。在表征了限制性障碍之后,我们概述了未来研究的有希望的方向。
引用
@article{arxiv.2404.09349,
title = {Adversarial Robustness Limits via Scaling-Law and Human-Alignment Studies},
author = {Brian R. Bartoldson and James Diffenderfer and Konstantinos Parasyris and Bhavya Kailkhura},
journal= {arXiv preprint arXiv:2404.09349},
year = {2024}
}
备注
ICML 2024