中文

LVCSR中无格与基于格的序列判别训练准则的比较

音频与语音处理 2020-05-21 v1 计算与语言 机器学习 声音 机器学习

摘要

序列判别训练准则长期以来一直是自动语音识别中用于提升声学模型性能、优于最大似然/交叉熵训练对应模型的标准工具。虽然先前需要对搜索空间进行格近似以降低计算复杂度,但近期提出的方法使用其他近似以消除计算代价高昂的单独建格步骤。本工作中,我们提出了一种内存高效的前向后向计算实现,使得我们能够在分母计算中使用一元词级语言模型,同时仍在GPU上做完整求和。这允许我们直接比较基于格与无格的序列判别训练准则(如MMI和sMBR),两者在训练中使用相同的语言模型。我们在Switchboard和Quaero等大词汇量连续语音识别任务上比较了性能、收敛速度与稳定性。我们发现静音建模严重影响无格情形下的性能,需要特殊处理。在我们的实验中,无格MMI与其基于格的对应方法表现相当。基于格的sMBR仍优于所有无格训练准则。

关键词

引用

@article{arxiv.1907.01409,
  title  = {Comparison of Lattice-Free and Lattice-Based Sequence Discriminative Training Criteria for LVCSR},
  author = {Wilfried Michel and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:1907.01409},
  year   = {2020}
}

备注

Submitted to Interspeech 2019