中文

在对抗训练上折中取舍

机器学习 2023-10-05 v1

摘要

对抗样本的存在指出了深度神经网络的一个基本弱点。针对此类样本最有效的防御之一——对抗训练,需要在一定程度上训练具有鲁棒性的模型,通常以牺牲自然准确率为代价。大多数对抗训练方法旨在学习一个模型,为每个类别找到涵盖干净样本与扰动样本的共同决策边界。在本工作中,我们采取一种根本不同的方法,将每个类别的扰动样本视为一个待学习的独立类别,从而有效地将每个类别拆分为两个类别:“干净”与“对抗”。这种拆分使待学习的类别数量翻倍,但同时也大幅简化了决策边界。我们提供了一个理论上的合理性论证,阐明在何种条件下我们的方法可望带来益处。同样,我们通过实证证明,我们的方法学习到鲁棒模型的同时达到了最优或接近最优的自然准确率,例如,在 CIFAR-10 上我们获得了 95.01%95.01\% 的接近最优自然准确率,并在多个任务上具备显著鲁棒性。在保持显著鲁棒性水平的同时实现此类接近最优的自然准确率,使我们的方法适用于自然准确率极为宝贵的现实应用。总体而言,我们的主要贡献是一种通用方法,它赋予分类器显著水平的鲁棒性,而仅使其自然准确率发生轻微或可忽略的退化。

关键词

引用

@article{arxiv.2310.02480,
  title  = {Splitting the Difference on Adversarial Training},
  author = {Matan Levi and Aryeh Kontorovich},
  journal= {arXiv preprint arXiv:2310.02480},
  year   = {2023}
}