中文

解释内在维度在对抗训练中的作用

机器学习 2025-05-27 v2 计算与语言

摘要

对抗训练(AT)以不同方式影响不同的架构:视觉模型获得鲁棒性但面临泛化能力下降,基于编码器的模型表现出有限的鲁棒性提升且泛化损失最小,而最近在潜在空间对抗训练(LAT)方面的工作表明,基于解码器的模型通过在多个层上应用AT实现了更好的鲁棒性。我们通过利用流形猜想首次解释了这些趋势:流形外的对抗样本(AE)增强鲁棒性,而流形上的AE改善泛化。我们表明,视觉和基于解码器的模型在较早的层中表现出低内在维度(有利于流形外的AE),而基于编码器的模型在较晚的层中表现出低内在维度(有利于流形上的AE)。利用这一特性,我们引入了SMAAT,它通过扰动具有最低内在维度的层来提高AT对基于编码器的模型的可扩展性。这减少了生成AE所需的投影梯度下降(PGD)链长度,将GPU时间减少了25-33%,同时显著提升了鲁棒性。我们在多个任务上验证了SMAAT,包括文本生成、情感分类、安全过滤和检索增强生成设置,展示了与标准训练相当的泛化能力下的优越鲁棒性。

关键词

引用

@article{arxiv.2405.17130,
  title  = {Explaining the role of Intrinsic Dimensionality in Adversarial Training},
  author = {Enes Altinisik and Safa Messaoud and Husrev Taha Sencar and Hassan Sajjad and Sanjay Chawla},
  journal= {arXiv preprint arXiv:2405.17130},
  year   = {2025}
}