将无网格最大互信息集成到端到端语音识别中
计算与语言
2022-08-24 v3 声音
音频与语音处理
摘要
在自动语音识别(ASR)研究中,判别准则在DNN-HMM系统中取得了优越的性能。鉴于这一成功,采用判别准则有望提升端到端(E2E)ASR系统的性能。受此驱动,先前的工作已将最小贝叶斯风险(MBR,判别准则之一)引入E2E ASR系统。然而,基于MBR的方法的有效性和效率受到限制:MBR准则仅用于系统训练,这造成了训练与解码之间的不匹配;基于MBR的方法中的即时解码过程导致需要预训练模型且训练速度慢。为此,本文提出新算法,将另一种广泛使用的判别准则——无网格最大互信息(LF-MMI)——集成到E2E ASR系统中,不仅在训练阶段,也在解码过程中。所提出的LF-MMI训练和解码方法在两个广泛使用的E2E框架上展示了其有效性:基于注意力的编码器-解码器(AED)和神经转导器(NT)。与基于MBR的方法相比,所提出的LF-MMI方法:保持训练与解码的一致性;避开即时解码过程;从随机初始化模型训练且具有更优的训练效率。实验表明,LF-MMI方法优于其MBR对应方法,并在从30小时到14.3k小时的各种框架和数据集上持续带来统计显著的性能提升。所提方法在Aishell-1(CER 4.10%)和Aishell-2(CER 5.02%)数据集上取得了最先进(SOTA)结果。代码已发布。
引用
@article{arxiv.2203.15614,
title = {Integrating Lattice-Free MMI into End-to-End Speech Recognition},
author = {Jinchuan Tian and Jianwei Yu and Chao Weng and Yuexian Zou and Dong Yu},
journal= {arXiv preprint arXiv:2203.15614},
year = {2022}
}
备注
in IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2022