中文

基于平均词错误准则的 RNNLM 判别训练

计算与语言 2018-11-09 v2 机器学习

摘要

在自动语音识别 (ASR) 中,循环神经网络语言模型 (RNNLM) 通常用于以词格或 n-best 列表形式对假设进行精炼,这些假设由带有较弱语言模型的集束搜索解码器生成。RNNLM 通常使用困惑度 (PPL) 准则在语法正确的大型文本语料库上以生成式方式进行训练。然而,假设是有噪声的,且 RNNLM 并不总是做出使我们所优化的指标——词错误率 (WER) 最小化的选择。为解决这种不匹配,我们提出使用任务特定的损失来训练 RNNLM,以在词格重打分场景中区分多个假设。通过在词格上以平均编辑距离损失对 RNNLM 进行微调,我们表明相对于纯生成式训练的模型,我们在词错误率上获得了 1.9% 的相对提升。

关键词

引用

@article{arxiv.1811.02528,
  title  = {Discriminative training of RNNLMs with the average word error criterion},
  author = {Rémi Francis and Tom Ash and Will Williams},
  journal= {arXiv preprint arXiv:1811.02528},
  year   = {2018}
}

备注

Sumbitted to ICASSP 2019