中文

通过局部梯度对齐实现更鲁棒的神经网络解释

计算机视觉与模式识别 2022-12-08 v2

摘要

神经网络解释方法,尤其是特征归因方法,已知对对抗性输入扰动十分脆弱。为此,人们提出了若干在训练时增强梯度局部平滑性的方法,以获得鲁棒的特征归因。然而,忽视归因的归一化(在其可视化中至关重要)一直是理解和改进特征归因方法鲁棒性的障碍。本文通过考虑此种归一化提供了新的见解。首先,我们证明对于每个非负齐次神经网络,朴素的梯度 ℓ_2 鲁棒准则不是归一化不变的,这意味着两个具有相同的归一化梯度的函数可以具有不同的值。其次,我们构建了基于归一化不变的余弦距离准则并推导了其上界,这揭示了为何如先前工作那样简单地最小化输入处的 Hessian 范数不足以获得鲁棒特征归因。最后,我们提出将 ℓ_2 与基于余弦距离的准则作为正则化项结合,以兼顾二者在局部梯度对齐上的优势。实验表明,与近期基线相比,用我们的方法训练的模型在 CIFAR-10 和 ImageNet-100 上产生了更鲁棒的解释,且未显著损害准确率。据我们所知,得益于我们方法的计算效率,这是首个在超越 CIFAR-10 的更大规模数据集上验证解释鲁棒性的工作。

关键词

引用

@article{arxiv.2211.15900,
  title  = {Towards More Robust Interpretation via Local Gradient Alignment},
  author = {Sunghwan Joo and Seokhyeon Jeong and Juyeon Heo and Adrian Weller and Taesup Moon},
  journal= {arXiv preprint arXiv:2211.15900},
  year   = {2022}
}

备注

22 pages (9 pages in paper, 13 pages in Appendix), 9 figures, 6 tables Accepted in AAAI 23 (Association for the Advancement of Artificial Intelligence)