输入长度至关重要:改进 RNN-T 与 MWER 训练以提升长格式电话语音识别
音频与语音处理
2022-04-05 v2 计算与语言
摘要
端到端模型已在多项自动语音识别任务上取得最先进的结果。然而,当在长格式数据(例如数分钟的对话电话音频)上评估时,其表现不佳。模型在长格式语音上失败的一个原因是其在训练期间仅见过短 utterance。本文中,我们研究了训练 utterance 长度对 RNN-transducer(RNN-T)模型词错误率(WER)的影响。我们比较了两种广泛使用的训练目标:对数损失(或 RNN-T 损失)与最小词错误率(MWER)损失。我们在四种语言的电话数据集上开展实验。实验表明,对于两种损失,长格式语音上的 WER 随训练 utterance 长度增加而显著下降。对数损失的平均相对 WER 增益为 15.7%,MWER 损失为 8.8%。当在短 utterance 上训练时,MWER 损失导致的 WER 低于对数损失。随着输入长度增加,两种损失间的此种差异逐渐消失。
引用
@article{arxiv.2110.03841,
title = {Input Length Matters: Improving RNN-T and MWER Training for Long-form Telephony Speech Recognition},
author = {Zhiyun Lu and Yanwei Pan and Thibault Doutre and Parisa Haghani and Liangliang Cao and Rohit Prabhavalkar and Chao Zhang and Trevor Strohman},
journal= {arXiv preprint arXiv:2110.03841},
year = {2022}
}
备注
submitted to INTERSPEECH 2022