灾难性过拟合可由判别性非鲁棒特征诱发
机器学习
2023-08-16 v2 人工智能
计算机视觉与模式识别
摘要
对抗训练(AT)是构建鲁棒神经网络的事实标准方法,但其计算开销可能很大。为缓解此问题,可使用快速单步攻击,但这可能导致灾难性过拟合(CO)。该现象出现在网络在AT初期获得非平凡鲁棒性,随后达到一个临界点,仅在少数几次迭代内便变得脆弱。导致这一失败模式的机制仍知之甚少。本工作中,我们通过受控修改典型自然图像数据集,研究单步AT方法中CO的发生。具体而言,我们表明,仅通过注入具有看似无害特征的图像,就能在比此前观测到的小得多的值下诱发CO。这些特征有助于非鲁棒分类,但本身不足以实现鲁棒性。通过大量实验,我们分析了这一新现象,并发现这些简单特征的存在诱发了导致CO的学习捷径。我们的发现为CO的机制提供了新见解,并增进了我们对AT动态过程的理解。复现实验的代码见 https://github.com/gortizji/co_features。
引用
@article{arxiv.2206.08242,
title = {Catastrophic overfitting can be induced with discriminative non-robust features},
author = {Guillermo Ortiz-Jiménez and Pau de Jorge and Amartya Sanyal and Adel Bibi and Puneet K. Dokania and Pascal Frossard and Gregory Rogéz and Philip H. S. Torr},
journal= {arXiv preprint arXiv:2206.08242},
year = {2023}
}
备注
Published in Transactions on Machine Learning Research (TMLR)