分布内与分布外对抗鲁棒性提升可解释性
机器学习
2020-07-30 v2 计算机视觉与模式识别
机器学习
摘要
神经网络在图像分类上取得了重大进展,但存在对对抗性改动不鲁棒、在分布外样本上不确定性估计不可靠以及黑盒决策难以理解的问题。在本工作中,我们提出 RATIO,一种通过分布内与分布外对抗训练(Robustness via Adversarial Training on In- and Out-distribution)的训练流程,其可得到在分布外具有可靠且鲁棒置信度估计的鲁棒模型。RATIO 具有与对抗训练类似的生成性质,使得视觉反事实产生类特定特征。虽然对抗训练以干净准确率下降为代价,RATIO 在 CIFAR10 上取得了最先进的 对抗鲁棒性并保持更好的干净准确率。
引用
@article{arxiv.2003.09461,
title = {Adversarial Robustness on In- and Out-Distribution Improves Explainability},
author = {Maximilian Augustin and Alexander Meinke and Matthias Hein},
journal= {arXiv preprint arXiv:2003.09461},
year = {2020}
}