中文

PubDef:抵御来自公开模型的迁移攻击

机器学习 2024-03-19 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

对抗攻击一直是工业界中潜伏且未获解决的威胁。然而,通过长达十年的鲁棒性评估文献,我们认识到发起强攻击或最优攻击颇具挑战,其需要机器学习与领域专业知识。换言之,过去绝大多数文献所严格假设的白盒威胁模型并不现实。本文提出一种新的实用威胁模型,其中 adversary 依赖通过公开可用的替代模型进行迁移攻击。我们认为该设定将成为未来安全敏感应用最普遍的形态。我们在此设定下评估了迁移攻击,并基于博弈论视角提出了一种专门防御方法。该防御在 3 个数据集(CIFAR-10、CIFAR-100 与 ImageNet)上的 24 个公开模型与 11 种攻击算法下接受评估。在此威胁模型中,我们的防御方法 PubDef 大幅优于最先进的白盒对抗训练,且正常准确率几乎无损失。例如,在 ImageNet 上,我们的防御在最强迁移攻击下达到 62% 准确率,而最佳对抗训练模型仅 36%。其无攻击时准确率仅比未防御模型低 2%(78% 对 80%)。我们在 https://github.com/wagner-group/pubdef 发布了代码。

关键词

引用

@article{arxiv.2310.17645,
  title  = {PubDef: Defending Against Transfer Attacks From Public Models},
  author = {Chawin Sitawarin and Jaewon Chang and David Huang and Wesson Altoyan and David Wagner},
  journal= {arXiv preprint arXiv:2310.17645},
  year   = {2024}
}

备注

ICLR 2024. Code available at https://github.com/wagner-group/pubdef