中文

利用在线数据增强改进序列到序列语音识别训练

音频与语音处理 2020-02-04 v2 计算机视觉与模式识别 机器学习 声音

摘要

序列到序列(S2S)模型近来开始在自动语音识别(ASR)中展现出最先进的性能。对于这些庞大而深度的模型,过拟合仍是最主要的问题,其影响超过了从更优架构中可获得的性能提升。过拟合问题的一个解决方案是借助数据增强来增加可用训练数据的数量及其所展现的多样性。本文研究了三种数据增强方法对两种S2S模型架构性能的影响。其中一种数据增强方法来自文献,另外两种方法为我们自主开发——频域时间扰动与子序列采样。我们在Switchboard与Fisher数据上的实验展示了仅使用语音训练数据且未使用额外文本数据的S2S模型的最先进性能。

关键词

引用

@article{arxiv.1910.13296,
  title  = {Improving sequence-to-sequence speech recognition training with on-the-fly data augmentation},
  author = {Thai-Son Nguyen and Sebastian Stueker and Jan Niehues and Alex Waibel},
  journal= {arXiv preprint arXiv:1910.13296},
  year   = {2020}
}

备注

To appear in ICASSP 2020