中文

基于音素的大规模词汇语音识别神经转导器

计算与语言 2021-04-21 v4 音频与语音处理

摘要

为结合经典与端到端语音识别方法的优势,我们提出一种简单、新颖且具有竞争力的基于音素的神经转导器建模方法。比较了不同的对齐标签拓扑,并提出了基于词尾的音素标签增广以提升性能。利用音素的局部依赖性,我们采用简化的神经网络结构以及与外部词级语言模型的直截了当的集成,以保持 seq-to-seq 建模的一致性。我们还提出了一种使用逐帧交叉熵损失的简单、稳定且高效的训练流程。结果表明,大小为 1 的音素上下文已足以获得最佳性能。应用了一种简化的课程采样方法以进一步改进,并简要比较了不同的解码方法。我们最佳模型的总体性能与 TED-LIUM Release 2 和 Switchboard 语料库的当前最优(SOTA)结果相当。

关键词

引用

@article{arxiv.2010.16368,
  title  = {Phoneme Based Neural Transducer for Large Vocabulary Speech Recognition},
  author = {Wei Zhou and Simon Berger and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2010.16368},
  year   = {2021}
}

备注

accepted at ICASSP2021