中文

通过切向空间视角提高干净准确率:基于对抗训练的切向方向引导方法

机器学习 2026-04-17 v2 人工智能 密码学与安全

摘要

对抗训练已被证明在提高深度神经网络抗对抗攻击的鲁棒性方面效果显著。然而,这种增强鲁棒性往往会以显著下降干净数据准确率为代价。本文通过引入切向方向引导对抗训练(Tangent Direction Guided Adversarial Training, TART)方法,利用数据流形的几何结构来提升干净准确率。我们认为,对抗样本在法向分量较大的情况下会过度扭曲决策边界,从而降低干净准确率。TART 通过估计对抗样本的切向方向,并根据其切向分量的范数自适应调节扰动边界来解决此问题。迄今为止,TART 是首个显式融入切向空间与切向方向概念的对抗防御框架。大量在合成数据集和基准数据集上的实验表明,TART 在保持抗对抗攻击鲁棒性的同时, consistently 提升了干净准确率。

关键词

引用

@article{arxiv.2408.14728,
  title  = {Improving Clean Accuracy via a Tangent-Space Perspective on Adversarial Training},
  author = {Bongsoo Yi and Rongjie Lai and Yao Li},
  journal= {arXiv preprint arXiv:2408.14728},
  year   = {2026}
}