关于 HMM 与基于 CTC 的全上下文 ASR 模型的无格点增强 MMI 训练
音频与语音处理
2021-09-28 v2 机器学习
摘要
混合自动语音识别(ASR)模型通常以 CTC 或 LF-MMI 准则顺序训练。然而,它们具有截然不同的渊源,且通常实现于不同框架中。本文通过解耦建模单元与标签拓扑的概念并相应构建恰当分子/分母图,建立了混合声学建模(AM)的通用框架。在此框架中,我们表明 LF-MMI 是一种适用于有限上下文与全上下文模型、适用于 wordpiece/单字符/双字符/chenone 单元、且兼具 HMM/CTC 拓扑的强大训练准则。基于此框架,我们提出三种新颖训练方案:chenone(ch)/wordpiece(wp)-CTC-bMMI,以及具有训练性能、解码效率与解码时间戳精度不同优势的 wordpiece(wp)-HMM-bMMI。不同训练方案的优势在 Librispeech 上被全面评估,wp-CTC-bMMI 与 ch-CTC-bMMI 在两个真实世界 ASR 任务上评估以展示其有效性。此外,我们还表明双字符(bc) HMM-MMI 模型可充当优于传统非神经 GMM-HMM 的对齐模型。
引用
@article{arxiv.2107.04154,
title = {On lattice-free boosted MMI training of HMM and CTC-based full-context ASR models},
author = {Xiaohui Zhang and Vimal Manohar and David Zhang and Frank Zhang and Yangyang Shi and Nayan Singhal and Julian Chan and Fuchun Peng and Yatharth Saraf and Mike Seltzer},
journal= {arXiv preprint arXiv:2107.04154},
year = {2021}
}
备注
accepted by ASRU 2021