中文

通过输入梯度蒸馏缓解 $\ell_{\infty}$-范数对抗训练中的不均衡现象

计算机视觉与模式识别 2025-06-30 v3

摘要

对抗训练(AT)被认为是抵御对抗攻击的最有效防御手段。然而,近期研究揭示 \ell_{\infty}-范数对抗训练(\ell_{\infty}-AT)还会诱发分布不均的输入梯度,被称为不均衡现象。该现象使得在高归因或随机选取像素受扰动时,\ell_{\infty}-范数对抗训练模型比标准训练模型更脆弱,从而实现对 \ell_{\infty}-对抗训练模型的鲁棒且实用的黑盒攻击。本文提出一种简单而有效的方法,称为输入梯度蒸馏(IGD),以缓解 \ell_{\infty}-AT 中的不均衡现象。IGD 通过以余弦相似度对齐学生模型与标准训练模型的输入梯度,将标准训练教师模型的均衡决策模式蒸馏到 \ell_{\infty}-对抗训练学生模型中。实验表明,IGD 能在保持对抗鲁棒性的同时缓解不均衡现象及其威胁。与原始 \ell_{\infty}-AT 相比,IGD 在 ImageNet-C 中将针对归纳噪声、归纳遮挡、随机噪声和噪声图像的错误率分别降低至多 60%、16%、50% 和 21%。除实证实验外,我们还进行了理论分析以解释缓解不均衡现象为何能提升此类鲁棒性,并讨论了不均衡现象的严重程度随数据集图像分辨率变化的原因。我们的代码见 https://github.com/fhdnskfbeuv/Inuput-Gradient-Distillation

关键词

引用

@article{arxiv.2305.09305,
  title  = {Releasing Inequality Phenomenon in $\ell_{\infty}$-norm Adversarial Training via Input Gradient Distillation},
  author = {Junxi Chen and Junhao Dong and Xiaohua Xie and Jianhuang Lai},
  journal= {arXiv preprint arXiv:2305.09305},
  year   = {2025}
}

备注

16 pages. Accepted by IEEE TIFS