用于卷积语音识别模型全面内省的梯度调整神经元激活剖面
机器学习
2020-02-20 v1 声音
音频与语音处理
机器学习
摘要
基于深度学习的自动语音识别(ASR)模型非常成功,但难以解释。为了更好地理解人工神经网络(ANNs)如何完成任务,人们提出了内省方法。将此类技术从计算机视觉适配到语音识别并非易事,因为语音数据比图像数据更复杂且更难以解释。在这项工作中,我们引入梯度调整神经元激活剖面(GradNAPs)作为解释深度神经网络中特征和表示的方法。GradNAPs是ANNs对特定输入组的表征性响应,其包含了神经元对预测的相关性。我们展示了如何利用GradNAPs深入了解数据在ANNs中的处理方式。这包括可视化特征的不同方法以及对GradNAPs进行聚类,以比较给定网络任意层中不同输入组的嵌入。我们使用一个全卷积ASR模型演示了我们提出的技术。
引用
@article{arxiv.2002.08125,
title = {Gradient-Adjusted Neuron Activation Profiles for Comprehensive Introspection of Convolutional Speech Recognition Models},
author = {Andreas Krug and Sebastian Stober},
journal= {arXiv preprint arXiv:2002.08125},
year = {2020}
}