中文

视觉 Transformer 对抗训练中的良性过拟合

机器学习 2026-04-22 v1 人工智能

摘要

尽管 Vision Transformers (ViTs) 在广泛的视觉任务中取得了显著成功,但近期研究表明,与 Convolutional Neural Networks (CNNs) 一样,它们依然容易受到对抗样本的攻击。一种常见的经验性防御策略是对抗训练,然而其关于 ViTs 鲁棒性的理论基础在很大程度上仍未被探索。在本研究中,我们首次对简化 ViT 架构下的对抗训练进行了理论分析。我们证明,当在满足特定条件的信噪比下训练且处于适度的扰动预算内时,对抗训练使得 ViTs 能够在某些情形下实现近乎为零的鲁棒训练损失和鲁棒泛化误差。值得注意的是,这甚至在存在过拟合的情况下也能带来强大的泛化能力,这一现象被称为 \emph{良性过拟合},此前仅在 CNNs(采用对抗训练时)中被观察到。在合成数据集和真实世界数据集上的实验进一步验证了我们的理论发现。

关键词

引用

@article{arxiv.2604.19724,
  title  = {Benign Overfitting in Adversarial Training for Vision Transformers},
  author = {Jiaming Zhang and Meng Ding and Shaopeng Fu and Jingfeng Zhang and Di Wang},
  journal= {arXiv preprint arXiv:2604.19724},
  year   = {2026}
}

备注

arXiv admin note: text overlap with arXiv:2409.19345 by other authors