盲对抗训练:平衡准确率与鲁棒性
机器学习
2020-04-14 v1 机器学习
摘要
对抗训练(AT)旨在通过混合干净数据与对抗样本(AEs)来提升深度学习模型的鲁棒性。现有大多数 AT 方法可分为受限与无受限两类。受限 AT 需要预设统一的预算来约束训练过程中 AE 扰动的大小,所得结果对该预算高度敏感。另一方面,无受限 AT 使用无约束的 AEs,导致采用位于决策边界之外的 AEs;这些被高估的 AEs 显著降低了在干净数据上的准确率。这些局限意味着,现有 AT 方法难以在面对不同强度的攻击时获得兼具高准确率与高鲁棒性的全面鲁棒模型。针对该问题,本文提出一种名为盲对抗训练(BAT)的新型 AT 方法,以更好地平衡准确率与鲁棒性。该方法的核心思想是利用截断缩放策略自适应地估计非均匀预算来修正训练所用 AEs,确保 AEs 的强度动态位于合理范围内,最终提升 AT 模型的整体鲁棒性。在多个基准上使用 BAT 训练分类模型的实验结果表明了该方法的竞争性性能。
引用
@article{arxiv.2004.05914,
title = {Blind Adversarial Training: Balance Accuracy and Robustness},
author = {Haidong Xie and Xueshuang Xiang and Naijin Liu and Bin Dong},
journal= {arXiv preprint arXiv:2004.05914},
year = {2020}
}