中文

连接对抗鲁棒性与梯度可解释性

机器学习 2019-04-22 v2 人工智能 机器学习

摘要

对抗训练是一种通过将训练数据集用对抗样本增广来抵御对抗攻击的训练方案。令人惊讶的是,若干研究观察到,来自对抗训练 DNN 的损失梯度比来自标准 DNN 的视觉上更具可解释性。尽管该现象有趣,但仅有少数工作给出了解释。在本文中,我们试图弥合对抗鲁棒性与梯度可解释性之间的这一鸿沟。为此,我们确认对抗训练 DNN 的损失梯度与人类感知更一致,因为对抗训练将梯度限制在更靠近图像流形的位置。我们随后证明对抗训练使损失梯度具有定量意义。最后,我们展示了在对抗训练框架下,测试准确率与损失梯度可解释性之间存在经验性权衡,并提出了两种潜在方法来解决该权衡。

关键词

引用

@article{arxiv.1903.11626,
  title  = {Bridging Adversarial Robustness and Gradient Interpretability},
  author = {Beomsu Kim and Junghoon Seo and Taegyun Jeon},
  journal= {arXiv preprint arXiv:1903.11626},
  year   = {2019}
}

备注

Accepted at the 2019 ICLR Workshop on Safe Machine Learning: Specification, Robustness, and Assurance (SafeML 2019)