面向流式 CTC 训练的自动语音识别模型:聚焦判别式训练
机器学习
2024-08-26 v1
摘要
本文引入一种新颖的训练框架,称为聚焦判别式训练 (FDT),用于进一步提高使用 CTC 或 CTC 与注意力基于编码器-解码器 (AED) 损失插值的流式 word-piece 端到端 (E2E) 自动语音识别 (ASR) 模型的性能。该方法提出了一种新框架,用于识别和改进模型在音频中具有挑战性片段的识别能力。值得注意的是,这种训练框架独立于隐藏马尔可夫模型 (HMM) 和 lattice,消除了在标准判别式训练方法中通常需要对 HMM 拓扑、词典和图生成进行大量决策的需求。与在编码器上使用额外的 MMI 或 MWER 损失进行微调相比,FDT 在 LibriSpeech 上对流式模型实现了更大的词错误率 (WER) 降低。此外,该方法在 60 万小时助理和语音输入数据集上训练的收敛 word-piece 流式 E2E 模型方面也表现出色。
引用
@article{arxiv.2408.13008,
title = {Focused Discriminative Training For Streaming CTC-Trained Automatic Speech Recognition Models},
author = {Adnan Haider and Xingyu Na and Erik McDermott and Tim Ng and Zhen Huang and Xiaodan Zhuang},
journal= {arXiv preprint arXiv:2408.13008},
year = {2024}
}
备注
UK Speech 2024, Submitted to SLT 2024