面向静态知识蒸馏的可解释神经元嵌入方法
机器学习
2022-11-16 v1 人工智能
摘要
尽管深度神经网络在各种任务中表现出良好的性能,但模型可解释性差一直受到诟病。在本文中,我们提出了一种新的可解释神经网络方法,通过将神经元嵌入到语义空间来提取其内在的全局语义。与以往探查模型内部潜在知识的方法不同,所提出的语义向量将潜在知识外化为静态知识,易于利用。具体而言,我们假设具有相似激活的神经元具有相似的语义信息。随后,在神经网络训练过程中,通过持续对齐激活相似度与语义向量相似度来优化语义向量。语义向量的可视化可对神经网络进行定性解释。此外,我们通过知识蒸馏任务对静态知识进行定量评估。可视化的实证实验表明,语义向量能很好地描述神经元激活语义。在没有来自教师模型的逐样本指导的情况下,静态知识蒸馏表现出与现有基于关系的知识蒸馏方法相当甚至更优的性能。
引用
@article{arxiv.2211.07647,
title = {An Interpretable Neuron Embedding for Static Knowledge Distillation},
author = {Wei Han and Yangqiming Wang and Christian Böhm and Junming Shao},
journal= {arXiv preprint arXiv:2211.07647},
year = {2022}
}