中文

MTLM:将双向文本信息纳入以增强语音识别系统中语言模型训练

计算与语言 2025-06-17 v2 音频与语音处理

摘要

自动语音识别(ASR)系统通常由声学模型(AM)和语言模型(LM)组成。声学模型估计给定输入语音的文本概率分布,而语言模型则将此分布校准以针对特定知识领域产生最终转录文本。传统的 ASR 专用语言模型通常以单向(左到右)方式训练,以匹配自回归解码。然而,这限制了模型在训练时利用右侧上下文的能力,限制了其表征能力。本文提出MTLM,一种通过三个训练目标(ULM、BMLM 和 UMLM)将单向和双向方式统一的新型训练范式。该方法增强了语言模型捕获左侧和右侧上下文中更丰富语言模式的能力,同时保持与标准 ASR 自回归解码方法的兼容性。结果表明,MTLM 模型不仅提升了 ASR 系统的性能,还支持多种解码策略,包括浅层融合、单向/双向 n-best 重排序。在 LibriSpeech 数据集上进行的实验表明,MTLM 在多种解码策略下均优于单向训练,凸显了其在 ASR 应用中的有效性和灵活性。

关键词

引用

@article{arxiv.2502.10058,
  title  = {MTLM: Incorporating Bidirectional Text Information to Enhance Language Model Training in Speech Recognition Systems},
  author = {Qingliang Meng and Pengju Ren and Tian Li and Changsong Dai and Huizhi Liang},
  journal= {arXiv preprint arXiv:2502.10058},
  year   = {2025}
}