中文

音节识别中混合模型与端到端模型的比较

计算与语言 2019-09-27 v1 机器学习 声音 音频与语音处理 机器学习

摘要

本文比较了传统的混合语音识别系统(使用 WFST 和 TDNN 结合无格 MMI 的 kaldi)与无词典端到端模型(采用 CTC 训练的多层 LSTM 的 TensorFlow 实现),二者均在 Verbmobil 语料库上进行德语音节识别。结果表明,在构建识别系统时显式建模先验知识仍然具有价值。基于音节的强语言模型(LM)下,结构化方法显著优于端到端模型。关于音节的最佳词错误率(WER)由使用 4-gram LM 的 kaldi 取得,该模型对训练集中观察到的所有音节进行建模。其音节 WER 为 10.0%,而端到端方法的最佳 WER 为 27.53%。本文工作对构建独立于大词汇表的未来识别系统具有启示意义,这类系统通常用于音节或黏着语识别、集外词技术、关键词搜索索引及医学语音处理等任务。

关键词

引用

@article{arxiv.1909.12232,
  title  = {A Comparison of Hybrid and End-to-End Models for Syllable Recognition},
  author = {Sebastian P. Bayerl and Korbinian Riedhammer},
  journal= {arXiv preprint arXiv:1909.12232},
  year   = {2019}
}

备注

22th International Conference of Text, Speech and Dialogue TSD2019