通过神经激活敏感性正则化提升可解释性
机器学习
2022-11-17 v1 密码学与安全
计算机视觉与模式识别
摘要
最先进的深度神经网络(DNN)在应对许多现实任务时极为有效。然而,其在关键任务场景中的广泛采用受两大弱点阻碍——易受对抗攻击及其不透明性。前者引发对 DNN 在真实条件下安全性与泛化能力的担忧,后者则阻碍用户对其输出的信任。本研究中,我们(1)考察对抗鲁棒性对可解释性的影响;(2)提出一种基于神经激活敏感性正则化、用于提升 DNN 可解释性的新方法。我们将用本法训练的模型之可解释性与标准模型及用最先进对抗鲁棒性技术训练的模型进行比较。结果表明,对抗鲁棒模型优于标准模型,且用我们所提方法训练的模型在可解释性上更优于对抗鲁棒模型。
引用
@article{arxiv.2211.08686,
title = {Improving Interpretability via Regularization of Neural Activation Sensitivity},
author = {Ofir Moshe and Gil Fidel and Ron Bitton and Asaf Shabtai},
journal= {arXiv preprint arXiv:2211.08686},
year = {2022}
}