从原始语音中学习滤波器组用于音素识别
计算与语言
2018-04-05 v2
摘要
我们训练了一组作用于原始波形并输入卷积神经网络以进行端到端音素识别的复滤波器。这些时域滤波器组(TD-filterbanks)初始化为梅尔滤波器组的近似,然后与剩余的卷积架构联合微调。我们在 TIMIT 上进行音素识别实验,表明对于多种架构,在 TD-filterbanks 上训练的模型始终优于在可比较的梅尔滤波器组上训练的对应模型。我们通过学习所有前端步骤(从预加重到平均)获得了最佳性能。最后,我们观察到收敛时的滤波器具有非对称脉冲响应,且其中一些几乎为解析的。
引用
@article{arxiv.1711.01161,
title = {Learning Filterbanks from Raw Speech for Phone Recognition},
author = {Neil Zeghidour and Nicolas Usunier and Iasonas Kokkinos and Thomas Schatz and Gabriel Synnaeve and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:1711.01161},
year = {2018}
}
备注
Accepted at ICASSP 2018