中文

从原始波形进行的端到端语音识别

计算与语言 2018-06-22 v2 声音 音频与语音处理

摘要

最先进的语音识别系统依赖于固定的、手工设计的特征(如梅尔滤波器组)在训练流程前对波形进行预处理。本文中,我们研究直接从原始波形训练的端到端系统,基于两种作为梅尔滤波器组可训练替代的卷积架构。第一种受伽马通滤波器组启发(Hoshen 等,2015;Sainath 等,2015),第二种受散射变换启发(Zeghidour 等,2017)。我们提出对这两种架构的两处修改,并在 Wall Street Journal 数据集上系统地将其与梅尔滤波器组比较。第一处修改是加入实例归一化层,这极大改善了基于伽马通的可训练滤波器组,并加速了基于散射的滤波器组的训练。第二处涉及这些方法中使用的低通滤波器。这些修改持续改善了两种方法的表现,并消除了基于散射的可训练滤波器组对精心初始化的需求。特别地,我们展示了可训练滤波器组相对可比梅尔滤波器组在词错误率上的持续改善。这是端到端模型从原始信号训练在干净录音条件下的大词汇量任务上显著优于梅尔滤波器组的首次报道。

关键词

引用

@article{arxiv.1806.07098,
  title  = {End-to-End Speech Recognition From the Raw Waveform},
  author = {Neil Zeghidour and Nicolas Usunier and Gabriel Synnaeve and Ronan Collobert and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:1806.07098},
  year   = {2018}
}

备注

Accepted for presentation at Interspeech 2018