探索端到端卷积神经网络中的谱时特征
机器学习
2019-01-03 v1 计算与语言
声音
机器学习
摘要
三角、重叠的梅尔尺度滤波器(“f-banks”)是当前利用输入时频几何结构的声学模型的标准输入,因为它们为语音信号提供了基于心理声学动机的时频几何结构。f-bank 系数被证明对尺度上的微小形变具有鲁棒性。在本文中,我们探索了为语音识别目的调整滤波器组的两种方式。首先,三角滤波器可被 Gabor 滤波器(一种在时域上更好定位事件的紧支撑滤波器)或 Gammatone 滤波器(一种基于心理声学动机的滤波器)所替代。其次,通过重新排列计算滤波器组特征中的操作顺序,可以在提供更优频率分辨率的同时在更小时间尺度上积分特征。我们通过开源仓库在线提供所有特征实现。使用现代端到端 CNN 音素识别器的初步实验表明,上述任一修改均未使音素错误率得到显著改善。本文讨论了该结果及其关于已学习滤波器组的启示。
引用
@article{arxiv.1901.00072,
title = {Exploring spectro-temporal features in end-to-end convolutional neural networks},
author = {Sean Robertson and Gerald Penn and Yingxue Wang},
journal= {arXiv preprint arXiv:1901.00072},
year = {2019}
}