中文

重新思考对抗训练中的不变性正则化以改善鲁棒性与准确率的权衡

机器学习 2025-08-29 v4 人工智能

摘要

对抗训练通常面临鲁棒性与准确率的权衡,即获得高鲁棒性以牺牲准确率为代价。缓解这一权衡的一种方法是利用不变性正则化,它鼓励模型在对抗扰动下保持不变性;然而,这仍会导致准确率损失。在本工作中,我们深入分析了在对抗训练中使用不变性正则化所面临的挑战,并研究如何解决这些问题。我们的分析指出了两个关键问题:(1)不变性目标与分类目标之间的“梯度冲突”,导致次优收敛;(2)由干净输入与对抗输入分布发散引起的混合分布问题。为了解决这些问题,我们提出了非对称表示正则化对抗训练,该方法结合了带有停止梯度操作的非对称不变性损失和预测器以避免梯度冲突,并采用分离 BatchNorm(BN)结构来解决混合分布问题。我们的详细分析表明,每个组件都有效地解决了所识别的问题,为对抗防御提供了新见解。ARAT 在各种设置下均展现出优于现有方法的优越性。最后,我们讨论了这些发现对基于知识蒸馏的防御方法的启示,为它们的相对成功提供了新视角。

关键词

引用

@article{arxiv.2402.14648,
  title  = {Rethinking Invariance Regularization in Adversarial Training to Improve Robustness-Accuracy Trade-off},
  author = {Futa Waseda and Ching-Chun Chang and Isao Echizen},
  journal= {arXiv preprint arXiv:2402.14648},
  year   = {2025}
}

备注

ICLR 2025 Accepted. Codes are available here: https://github.com/futakw/AR-AT