重新审视对抗性训练与干净训练之间的关系:为何干净训练可以使对抗性训练更好
机器学习
2025-04-02 v1 人工智能
摘要
对抗性训练(Adversarial Training, AT)是增强对抗鲁棒性的有效技术,但通常会导致泛化能力下降。近期研究尝试利用干净训练辅助对抗性训练,但各项结论之间存在矛盾。我们全面总结了具有代表性的策略,并在多视角假设(multi-view hypothesis)的基础上,提供一种统一解释,说明不同研究中如何产生矛盾现象。此外,我们深入分析了从干净训练模型转移到对抗训练模型中的知识组合,发现其可分为两类:降低学习难度和提供正确指导。基于这一发现,我们提出一种新想法,利用干净训练进一步提高先进对抗性训练方法的性能。我们揭示,AT所面临的泛化性能 degradation 问题部分源于对抗训练难以学习某些样本特征的问题,而这一问题可以通过充分利用干净训练来缓解。
引用
@article{arxiv.2504.00038,
title = {Revisiting the Relationship between Adversarial and Clean Training: Why Clean Training Can Make Adversarial Training Better},
author = {MingWei Zhou and Xiaobing Pei},
journal= {arXiv preprint arXiv:2504.00038},
year = {2025}
}