中文

DUMB 与 DUMBer:在真实世界中,对抗训练值得吗?

密码学与安全 2025-06-24 v1

摘要

对抗样本是为误导机器学习模型而精心设计的小型且往往不可感知的扰动。这些攻击严重威胁深度神经网络的可靠性,尤其是在安全敏感领域。逃逸攻击是一种在测试时修改输入以导致误分类的对抗攻击方式,由于其可迁移性(即针对一个模型设计的对抗样本也常常欺骗其他模型),这一属性尤为隐蔽。已知的可迁移性限制了防御策略的有效性,因为它使黑盒攻击能够在没有直接访问受害模型的情况下成功。虽然对抗训练是最广泛采用的防御机制之一,但其有效性通常仅在狭窄且同质化的模型群体上进行评估。这一局限性阻碍了经验发现的可推广性,并限制了实际应用。在本工作中,我们引入 DUMBer,一个基于 DUMB(数据来源、模型架构和平衡)方法构建的攻击框架,以系统性地评估在多种对抗训练技术下,针对三个 diverse computer vision 任务中,使用异构模型群体(反映真实部署的可变性)对 adversarially 训练模型的韧性。我们的实验管线涉及超过 13 万次评估,覆盖 13 种最先进的攻击算法,使我们能够捕捉到在不同威胁模型和数据集条件下,对抗训练行为的细微差异。我们的发现为 AI 从业者提供了实用且可操作的见解,确定了基于模型、数据集和攻击者设置的哪些防御最有效。

关键词

引用

@article{arxiv.2506.18516,
  title  = {DUMB and DUMBer: Is Adversarial Training Worth It in the Real World?},
  author = {Francesco Marchiori and Marco Alecci and Luca Pajola and Mauro Conti},
  journal= {arXiv preprint arXiv:2506.18516},
  year   = {2025}
}

备注

Accepted at ESORICS 2025