中文

关于基于FST格的MMI训练的论述

机器学习 2022-10-18 v1 计算机视觉与模式识别

摘要

最大互信息(MMI)已成为语音识别声学模型序列级训练两种事实标准方法之一。本文旨在分离、辨识并揭示标准有限状态转导器(FST)格基MMI训练框架的设计实现所隐含的建模决策。文章特别考察了维持预选分子对齐的必要性,并提出了动态确定FST分母格的重要性。本文从数学上证明,采用动态FST格确定可保证假设层面的判别性,并通过在18K小时中文数据集与2.8K小时英文数据集上训练深度CNN模型予以实证。在助手与听写任务上,该方法相较标准FST格基方法取得了2.3–4.6%的相对词错率降低(WERR)。

关键词

引用

@article{arxiv.2210.08918,
  title  = {A Treatise On FST Lattice Based MMI Training},
  author = {Adnan Haider and Tim Ng and Zhen Huang and Xingyu Na and Antti Veikko Rosti},
  journal= {arXiv preprint arXiv:2210.08918},
  year   = {2022}
}

备注

Presented at Sane Worksop 2022 : https://www.saneworkshop.org/sane2022/