中文

探索端到端卷积神经网络中的谱时特征

机器学习 2019-01-03 v1 计算与语言 声音 机器学习

摘要

三角、重叠的梅尔尺度滤波器(“f-banks”)是当前利用输入时频几何结构的声学模型的标准输入,因为它们为语音信号提供了基于心理声学动机的时频几何结构。f-bank 系数被证明对尺度上的微小形变具有鲁棒性。在本文中,我们探索了为语音识别目的调整滤波器组的两种方式。首先,三角滤波器可被 Gabor 滤波器(一种在时域上更好定位事件的紧支撑滤波器)或 Gammatone 滤波器(一种基于心理声学动机的滤波器)所替代。其次,通过重新排列计算滤波器组特征中的操作顺序,可以在提供更优频率分辨率的同时在更小时间尺度上积分特征。我们通过开源仓库在线提供所有特征实现。使用现代端到端 CNN 音素识别器的初步实验表明,上述任一修改均未使音素错误率得到显著改善。本文讨论了该结果及其关于已学习滤波器组的启示。

关键词

引用

@article{arxiv.1901.00072,
  title  = {Exploring spectro-temporal features in end-to-end convolutional neural networks},
  author = {Sean Robertson and Gerald Penn and Yingxue Wang},
  journal= {arXiv preprint arXiv:1901.00072},
  year   = {2019}
}