中文

基于双头上下文轨迹LSTM模型的高精度低延迟语音识别

音频与语音处理 2020-03-18 v1 计算与语言 声音

摘要

尽管学界不断推广端到端模型以取代传统的混合模型(通常为以交叉熵准则训练、随后以序列判别训练准则训练的长短期记忆(LSTM)模型),我们认为此类传统混合模型仍可被显著改进。本文详述了我们近期为改进传统混合LSTM声学模型以实现高精度、低延迟自动语音识别所做的努力。为达到高精度,我们采用上下文轨迹LSTM(cltLSTM),其将时间建模与目标分类任务解耦,并引入未来上下文帧以获取更多信息用于准确的声学建模。我们进一步通过序列级师生学习改进训练策略。为获得低延迟,我们设计了双头cltLSTM,其中一个头具有零延迟,另一个头具有相对于LSTM的小延迟。当使用微软6.5万小时匿名训练数据训练,并以含180万词的测试集评估时,所提出的带提出训练策略的双头cltLSTM模型相较传统LSTM声学模型取得了28.2%的相对词错率降低,且感知延迟相近。

关键词

引用

@article{arxiv.2003.07482,
  title  = {High-Accuracy and Low-Latency Speech Recognition with Two-Head Contextual Layer Trajectory LSTM Model},
  author = {Jinyu Li and Rui Zhao and Eric Sun and Jeremy H. M. Wong and Amit Das and Zhong Meng and Yifan Gong},
  journal= {arXiv preprint arXiv:2003.07482},
  year   = {2020}
}

备注

Accepted by ICASSP 2020