黑盒对抗攻击的规模化定律
机器学习
2025-12-19 v4 计算机视觉与模式识别
摘要
对抗样本 exhibits跨模型可迁移性,使其能够对商业模型实施威胁性的黑盒攻击。模型集成作为攻击多个替代模型的策略,已知可提高此类可迁移性。然而,先前研究通常使用小型固定集成,仍未探讨是否通过扩大替代模型数量来进一步提高黑盒攻击的效果。本文进行了这一问题的首次大规模实证研究。我们展示,通过采用先进优化器解决梯度冲突,发现一种鲁棒且普遍的对数线性规模化定律:攻击成功率(ASR)随着集成规模 的对数线性增长。我们在标准分类器、SOTA防御措施和MLLMs上严格验证了该定律,并发现规模化提炼出目标类别的鲁棒、语义特征。因此,我们将这一根本性洞见应用于对SOTA MLLMs进行基准测试。我们揭示了该攻击的毁灭性力量以及清晰的鲁棒性层级:我们在GPT-4o等专有模型上实现80%以上的转移攻击成功率,同时也凸显了Claude-3.5-Sonnet的异常韧性。我们的发现敦促关注者将鲁棒性评估的焦点从在小型集成上设计复杂算法,转向理解规模化带来的原则性强大威胁。
引用
@article{arxiv.2411.16782,
title = {Scaling Laws for Black box Adversarial Attacks},
author = {Chuan Liu and Huanran Chen and Yichi Zhang and Jun Zhu and Yinpeng Dong},
journal= {arXiv preprint arXiv:2411.16782},
year = {2025}
}