中文

分布内与分布外对抗鲁棒性提升可解释性

机器学习 2020-07-30 v2 计算机视觉与模式识别 机器学习

摘要

神经网络在图像分类上取得了重大进展,但存在对对抗性改动不鲁棒、在分布外样本上不确定性估计不可靠以及黑盒决策难以理解的问题。在本工作中,我们提出 RATIO,一种通过分布内与分布外对抗训练(Robustness via Adversarial Training on In- and Out-distribution)的训练流程,其可得到在分布外具有可靠且鲁棒置信度估计的鲁棒模型。RATIO 具有与对抗训练类似的生成性质,使得视觉反事实产生类特定特征。虽然对抗训练以干净准确率下降为代价,RATIO 在 CIFAR10 上取得了最先进的 l2l_2 对抗鲁棒性并保持更好的干净准确率。

关键词

引用

@article{arxiv.2003.09461,
  title  = {Adversarial Robustness on In- and Out-Distribution Improves Explainability},
  author = {Maximilian Augustin and Alexander Meinke and Matthias Hein},
  journal= {arXiv preprint arXiv:2003.09461},
  year   = {2020}
}