中文

Watertox:通用攻击中简单之艺——面向鲁棒对抗生成的跨模型框架

计算机视觉与模式识别 2024-12-23 v1 人工智能 密码学与安全

摘要

当代对抗攻击方法在跨模型可迁移性和实际适用性方面面临显著局限。我们提出 Watertox,一个通过架构多样性和精确控制扰动实现卓越效果的优雅对抗攻击框架。我们的两阶段快速梯度符号方法将统一基线扰动(ϵ1=0.1\epsilon_1 = 0.1)与定向增强(ϵ2=0.4\epsilon_2 = 0.4)相结合。该框架利用来自 VGG 到 ConvNeXt 的一组互补架构,通过一种创新的投票机制综合多元视角。针对最先进的架构,Watertox 将模型准确率从 70.6% 降至 16.0%,零步骤攻击对未见架构实现最高达 98.8% 的准确率降幅。这些结果将 Watertox 确立为对抗方法学领域的重大进步,具有在视觉安全系统和 CAPTCHA 生成中的广泛应用前景。

关键词

引用

@article{arxiv.2412.15924,
  title  = {Watertox: The Art of Simplicity in Universal Attacks A Cross-Model Framework for Robust Adversarial Generation},
  author = {Zhenghao Gao and Shengjie Xu and Meixi Chen and Fangyao Zhao},
  journal= {arXiv preprint arXiv:2412.15924},
  year   = {2024}
}

备注

18 pages, 4 figures, 3 tables. Advances a novel method for generating cross-model transferable adversarial perturbations through a two-stage FGSM process and architectural ensemble voting mechanism