中文

理解对抗训练深度神经网络的对数几率分布

机器学习 2021-08-30 v1 人工智能

摘要

对抗防御训练深度神经网络,使其对来自对抗攻击的输入扰动保持不变性。几乎所有防御策略都通过对抗训练(即在带有对抗扰动的输入上训练)来实现这种不变性。尽管对抗训练能成功缓解对抗攻击,但对抗训练(AT)模型与标准模型在行为上的差异仍知之甚少。受近期一项通过蒸馏 AT 模型在无输入扰动下学习鲁棒性研究的启发,我们通过分析 AT 模型中对数几率(logit)的分布来探究对抗训练中学习了什么。我们识别出对学习对抗鲁棒性至关重要的三个对数几率特征。首先,我们为以下发现提供理论依据:对抗训练缩小了对数几率分布的两个重要特征——AT 模型的最大对数几率值以及“对数几率间隙”(最大对数几率与次大值之差)平均更低。其次,我们表明 AT 模型与标准模型在哪些样本具有高或低置信度上存在显著差异,进而通过可视化置信度差异最大的样本来展示清晰的定性差异。最后,我们发现通过学习关于错误类别的信息对掌握鲁棒性至关重要,具体做法是在蒸馏过程中操纵非最大对数几率信息,并衡量对学生模型鲁棒性的影响。我们的结果表明,在无输入扰动下学习某种对抗鲁棒性,需要模型学习遵循复杂分布的特定样本级置信度与错误类别排序。

关键词

引用

@article{arxiv.2108.12001,
  title  = {Understanding the Logit Distributions of Adversarially-Trained Deep Neural Networks},
  author = {Landan Seguin and Anthony Ndirango and Neeli Mishra and SueYeon Chung and Tyler Lee},
  journal= {arXiv preprint arXiv:2108.12001},
  year   = {2021}
}

备注

29 pages (13 main, 16 supplemental), 22 figures (5 main, 17 supplemental)