通过解耦性能度量中的非鲁棒与鲁棒分量理解 DNN 的对抗行为
机器学习
2019-06-07 v1 机器学习
摘要
对微小输入扰动的脆弱性是深度神经网络(DNN)令人担忧却又引人入胜的性质。尽管许多先前工作研究了此种对抗行为背后的原因,DNN 的泛化性能与对抗行为间的关系仍鲜被理解。本工作中,我们透过引入刻画 DNN 泛化性能的度量为揭示此关系。该度量可被解耦为一个负责对抗行为的信息论非鲁棒分量,以及一个鲁棒分量。随后,我们通过实验显示当前 DNN 在取得尚可性能时严重依赖优化非鲁棒分量。我们也证明当前最先进的对抗训练算法确实试图通过阻止 DNN 使用非鲁棒分量区分不同类别样本来使其鲁棒化。并且,基于我们的发现,我们向前一步并指出同时取得尚可标准性能与对抗鲁棒性的可能方向。我们相信我们的理论能进一步启发学界对深度学习模型标准泛化与对抗泛化间关系做出更有趣的发现。
引用
@article{arxiv.1906.02494,
title = {Understanding Adversarial Behavior of DNNs by Disentangling Non-Robust and Robust Components in Performance Metric},
author = {Yujun Shi and Benben Liao and Guangyong Chen and Yun Liu and Ming-Ming Cheng and Jiashi Feng},
journal= {arXiv preprint arXiv:1906.02494},
year = {2019}
}