中文

面向端到端语音识别的 RNN-Transducer 高效最小词错率训练

音频与语音处理 2020-07-29 v1 计算与语言 机器学习 声音

摘要

在本工作中,我们提出一种新颖且高效的最小词错率(MWER)训练方法用于 RNN-Transducer(RNN-T)。与先前该主题工作中进行即时有限规模束搜索解码并为期望编辑距离计算生成对齐分数不同,在我们提出的方法中,我们对 N-best 列表中每个假设的所有可能对齐分数重新计算并求和。假设概率分数与反向传播的梯度利用前向-后向算法高效计算。此外,所提方法允许我们将解码与训练过程解耦,从而可对各个子集迭代执行离线并行解码与 MWER 训练。实验结果显示,该提出的半即时方法可将即时方法加速 6 倍,并取得相对于基线 RNN-T 模型相似的 WER 提升(3.6%)。当为端点器添加 EOS 时,所提 MWER 训练还能有效减少 RNN-T 模型引入的高删除错误(9.2% 的 WER 降低)。若我们使用提出的 RNN-T 重打分方法对假设重排序并利用外部 RNN-LM 进行额外重打分,可取得进一步改进。最佳系统在真实远场录音的英文测试集上取得 5% 的相对提升,在音乐域语句上取得 11.6% 的 WER 降低。

关键词

引用

@article{arxiv.2007.13802,
  title  = {Efficient minimum word error rate training of RNN-Transducer for end-to-end speech recognition},
  author = {Jinxi Guo and Gautam Tiwari and Jasha Droppo and Maarten Van Segbroeck and Che-Wei Huang and Andreas Stolcke and Roland Maas},
  journal= {arXiv preprint arXiv:2007.13802},
  year   = {2020}
}

备注

Accepted to Interspeech 2020