中文

识别与理解对抗训练中的跨类别特征

机器学习 2025-06-06 v1 人工智能 密码学与安全 计算机视觉与模式识别 最优化与控制

摘要

对抗训练 (AT) 被认为是使深度神经网络对对抗性攻击具有鲁棒性的最有效方法之一,但其训练机制和动态仍是开放的研究问题。本文我们提出了一种新颖的视角,通过类别特征归因的视角来研究 AT。具体我们识别了一类关键特征的影响,这些特征被多个类别共享,我们称之为跨类别特征。这些特征通常对鲁棒分类有用,我们通过合成数据模型提供了理论证据。通过在多个模型架构和设置下的系统研究,我们发现 AT 的初始阶段,模型倾向于学习更多跨类别特征,直至达到最佳鲁棒性检查点。进一步地,当 AT 进一步压缩训练鲁棒损失并导致鲁棒性过拟合时,模型倾向于基于更具类别特异性的特征做出决策。基于这些发现,我们进一步提供了两种现有 AT 属性的统一视图,包括软标签训练的优势和鲁棒性过拟合。总体而言,这些见解细化了当前对 AT 机制的理解,并为研究它们提供了新视角。我们的代码可在 https://github.com/PKU-ML/Cross-Class-Features-AT 查找。

关键词

引用

@article{arxiv.2506.05032,
  title  = {Identifying and Understanding Cross-Class Features in Adversarial Training},
  author = {Zeming Wei and Yiwen Guo and Yisen Wang},
  journal= {arXiv preprint arXiv:2506.05032},
  year   = {2025}
}

备注

ICML 2025