中文

关于对抗训练深度图像分类器的人类可识别现象

计算机视觉与模式识别 2021-01-14 v1 机器学习

摘要

本工作中,我们研究鲁棒图像分类器具有人类可识别特征(常被称为可解释性)的现象——通过其得分函数的输入梯度及随后的对抗扰动所揭示。具体而言,我们证明最先进的对抗训练方法包含两项:一项通过最小化期望损失来定向决策边界,另一项通过惩罚局部Lipschitz常数来诱导分类器决策面的平滑性。通过此证明,我们对先前工作中用于促进对抗鲁棒性的基于梯度与Jacobian的正则化器给出统一讨论。继此讨论,我们给出定性证据:决策边界的平滑性与定向之耦合足以诱导上述人类可识别现象。

关键词

引用

@article{arxiv.2101.05219,
  title  = {On the human-recognizability phenomenon of adversarially trained deep image classifiers},
  author = {Jonathan Helland and Nathan VanHoudnos},
  journal= {arXiv preprint arXiv:2101.05219},
  year   = {2021}
}