灾难性过拟合:潜在的因祸得福
机器学习
2024-02-29 v1 密码学与安全
摘要
快速对抗训练 (FAT) 因其在提高对抗鲁棒性方面的有效性,在研究界获得了越来越多的关注。其中特别值得注意的是该领域面临的灾难性过拟合 (CO) 挑战。尽管现有的 FAT 方法在缓解 CO 方面取得了进展,但对抗鲁棒性的提升伴随着干净样本分类准确率不可忽视的下降。为解决这一问题,我们最初利用干净样本与对抗样本之间的特征激活差异来分析 CO 的根本原因。有趣的是,我们的研究发现 CO 可归因于少数特定通路引起的特征覆盖。通过精心设计的正则化项有意操纵这些通路中的特征激活差异,我们可以有效地缓解或诱导 CO,从而为这一观察结果提供进一步证据。值得注意的是,使用这些项稳定训练的模型表现出优于先前 FAT 工作的性能。在此基础上,我们利用 CO 实现“攻击混淆”,旨在增强模型性能。因此,遭受 CO 的模型在评估期间向输入添加随机噪声时,可以在干净数据和对抗数据上达到最佳分类准确率。我们还验证了它们对迁移对抗样本的鲁棒性,以及诱导 CO 以提高鲁棒性的必要性。因此,CO 可能并非一个必须解决的问题。
引用
@article{arxiv.2402.18211,
title = {Catastrophic Overfitting: A Potential Blessing in Disguise},
author = {Mengnan Zhao and Lihe Zhang and Yuqiu Kong and Baocai Yin},
journal= {arXiv preprint arXiv:2402.18211},
year = {2024}
}