CGCNN:面向原始语音的复值 Gabor 卷积神经网络
声音
2020-02-12 v1 音频与语音处理
摘要
卷积神经网络(CNN)已被用于自动语音识别(ASR),以直接从原始信号而非手工声学特征中学习表征,从而提供更丰富且无损的输入信号。近期研究提出通过将脉冲响应形状整合进第一卷积层来注入先验声学知识,以提升所学声学模型的可解释性及其性能。我们提出将复值 Gabor 滤波器与复值深度神经网络相结合以替代常规 CNN 权值核,从而充分利用其最优时频分辨率及复值域优势。在 TIMIT 音素识别任务上的实验表明,所提方法在保持可解释性的同时达到了顶尖性能。
引用
@article{arxiv.2002.04569,
title = {CGCNN: Complex Gabor Convolutional Neural Network on raw speech},
author = {Paul-Gauthier Noé and Titouan Parcollet and Mohamed Morchid},
journal= {arXiv preprint arXiv:2002.04569},
year = {2020}
}