揭示快速对抗训练中灾难性过拟合背后的后门机制
机器学习
2026-04-28 v1 人工智能
密码学与安全
摘要
快速对抗训练(FAT)因其在增强神经网络对对抗攻击鲁棒性方面的效率而引起广泛关注。然而,FAT 容易出现灾难性过拟合(CO),即模型在训练时针对特定攻击过拟合,无法泛化到其他攻击。虽然已有方法引入多样性假设并提出 various 策略来缓解 CO,但 CO 的系统且直观的解释仍缺乏。本文通过后门视角创新性地解释了 CO。通过对路径划分、多样化特征预测和通用可区分触发器在 CO 中的验证,我们将 CO 概念化为不可训练任务的弱触发器变体,将 CO、后门攻击和不可训练任务统一置于常见理论框架下。基于此,我们利用后门启发的策略来缓解 CO:(i)通过 vanilla 微调、线性探测或重新初始化技术来校准受 CO 影响的模型参数;(ii)引入权重异常抑制约束以规范模型权重中的异常偏差。广泛实验支持我们对 CO 的解释,并显示所提出缓解策略的有效性。
引用
@article{arxiv.2604.24350,
title = {Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training},
author = {Mengnan Zhao and Lihe Zhang and Tianhang Zheng and Bo Wang and Baocai Yin},
journal= {arXiv preprint arXiv:2604.24350},
year = {2026}
}