中文

面向对抗防御评估的内存高效全梯度攻击(MEFA)框架

机器学习 2026-05-08 v1 人工智能 计算机视觉与模式识别

摘要

本工作研究了在白箱对抗攻击下,对迭代随机净化防御的鲁棒评估。我们的关键技术洞察在于,梯度检查点技术通过用额外的重计算来换取大幅降低的内存占用,从而使通过长时间净化轨迹的精确端到端梯度计算变得可行。这使得针对基于扩散和 Langevin 方法的净化防御进行全梯度自适应攻击成为可能,而以往的评估常因内存限制而采用近似反向传播。这些近似会削弱攻击信号并增加对鲁棒性的高估风险。此外,迭代净化中的随机性常被控制不足,尽管不同的净化轨迹会显著改变报告的鲁棒性指标。基于此洞察,我们引入了一个用于随机净化防御的内存高效全梯度评估框架。该框架将检查点化反向传播与控制随机变异性的评估协议相结合,在保持精确梯度的同时缓解内存瓶颈。我们评估了基于扩散的净化和基于能量基模型(EBM)的 Langevin 采样,结果表明全梯度攻击揭示了近似梯度评估所忽略的漏洞。我们的框架产生更强的 SOTA \ell_{\infty}2\ell_{2} 白箱攻击,并支持探测离群分布鲁棒性。总体而言,我们的结果表明,精确梯度评估对迭代随机防御的可靠基准测试至关重要。

关键词

引用

@article{arxiv.2605.06357,
  title  = {Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations},
  author = {Yuan Du and Mitchel Hill and HanQin Cai},
  journal= {arXiv preprint arXiv:2605.06357},
  year   = {2026}
}