关于困难对抗样本在对抗训练过拟合中的作用
机器学习
2024-12-18 v2
摘要
对抗训练是一种流行的使模型抵御对抗攻击的鲁棒化方法。然而,它比在干净输入上训练表现出更严重的过拟合。本工作中,我们从训练实例(即训练输入-目标对)的视角研究该现象。基于一个量化训练集中实例相对难度的度量,我们分析模型在不同难度级别训练实例上的行为。这使我们证明对抗训练泛化性能的衰减是拟合困难对抗实例的结果。我们从理论上验证了线性与一般非线性模型下的观察,证明在困难实例上训练的模型比在简单实例上训练的模型泛化性能更差,且此泛化差距随对抗预算大小而增加。最后,我们研究在多种场景下缓解对抗过拟合的解决方案,包括快速对抗训练与使用额外数据微调预训练模型。我们的结果表明,自适应地使用训练数据可提升模型的鲁棒性。
引用
@article{arxiv.2112.07324,
title = {On the Impact of Hard Adversarial Instances on Overfitting in Adversarial Training},
author = {Chen Liu and Zhichao Huang and Mathieu Salzmann and Tong Zhang and Sabine Süsstrunk},
journal= {arXiv preprint arXiv:2112.07324},
year = {2024}
}