用于自动语音识别的上下文语句训练
音频与语音处理
2022-10-31 v1 机器学习
声音
信号处理
摘要
近期关于基于循环神经网络转导器(RNN-T)的流式自动语音识别(ASR)系统的研究将过去的上下文信息输入编码器,以改善其词错误率(WER)性能。本文中,我们首先提出一种上下文语句训练技术,其利用前序与后续上下文语句,以对说话人、话题和声学环境进行隐式自适应。此外,我们提出一种用于流式自动语音识别(ASR)系统的双模上下文语句训练技术。该方法通过“就地”蒸馏能看到过去与未来上下文语句的教师模型的知识到只能看到当前与前序上下文语句的学生模型,更好地利用流式模型中可用的声学上下文。实验结果表明,采用所提技术训练的 conformer-transducer 系统优于使用经典 RNN-T 损失训练的同类系统。具体而言,所提技术能够相对降低 WER 和平均末词发射延迟分别超过 6% 和 40 毫秒。
引用
@article{arxiv.2210.16238,
title = {Contextual-Utterance Training for Automatic Speech Recognition},
author = {Alejandro Gomez-Alanis and Lukas Drude and Andreas Schwarz and Rupak Vignesh Swaminathan and Simon Wiesler},
journal= {arXiv preprint arXiv:2210.16238},
year = {2022}
}