中文

LISArD:学习图像相似性以防御灰盒对抗攻击

计算机视觉与模式识别 2025-03-03 v1 密码学与安全 机器学习

摘要

最先进的防御机制通常在白盒攻击的背景下进行评估,这并不现实,因为它假设攻击者可以访问目标网络的梯度。为了防范这种情况,对抗训练(AT)和对抗蒸馏(AD)在训练阶段包含对抗样本,而对抗净化使用生成模型来重建提供给分类器的所有图像。本文考虑了一个更现实的评估场景:灰盒攻击,它假设攻击者知道用于训练目标网络的架构和数据集,但无法访问其梯度。我们提供了模型容易受到灰盒攻击的经验证据,并提出了 LISArD,这是一种防御机制,它不增加计算和时间成本,但无需包含 AT 即可针对灰盒和白盒攻击提供鲁棒性。我们的方法在同时进行分类学习的过程中,将由扰动图像和干净图像的嵌入创建的互相关矩阵近似为对角矩阵。我们的结果表明,LISArD 可以有效防御灰盒攻击,可用于多种架构,并将其弹性延续到白盒场景。此外,最先进的 AD 模型在移除 AT 和/或转向灰盒设置时表现极差,突显了现有方法在各种条件下(白盒设置除外)执行时缺乏鲁棒性。所有源代码可在 https://github.com/Joana-Cabral/LISArD 获取。

关键词

引用

@article{arxiv.2502.20562,
  title  = {LISArD: Learning Image Similarity to Defend Against Gray-box Adversarial Attacks},
  author = {Joana C. Costa and Tiago Roxo and Hugo Proença and Pedro R. M. Inácio},
  journal= {arXiv preprint arXiv:2502.20562},
  year   = {2025}
}