大规模自动语音识别中单调换能器的研究
音频与语音处理
2022-10-25 v2 声音
摘要
流式端到端自动语音识别(ASR)中最常用的两种损失函数是 RNN-Transducer(RNN-T)和连接时序分类(CTC)。在这两类损失之间,我们可以归类出单调 RNN-T(MonoRNN-T)和最近提出的类 CTC 换能器(CTC-T)。单调换能器有几个优点。首先,RNN-T 可能遭受失控幻觉,即模型在不随时间推进的情况下持续输出非空白符号。其次,单调换能器每个时间步恰好消耗一个模型分数,因此与传统基于 FST 的 ASR 解码器更兼容。然而,迄今为止发现 MonoRNN-T 的准确率比 RNN-T 差。事情未必如此:通过联合 LAS 训练或从 RNN-T 进行参数初始化来正则化训练,MonoRNN-T 和 CTC-T 的表现都与 RNN-T 相当或更好。这一点在 LibriSpeech 和一个大规模内部数据集上得到了证明。
引用
@article{arxiv.2204.08858,
title = {An Investigation of Monotonic Transducers for Large-Scale Automatic Speech Recognition},
author = {Niko Moritz and Frank Seide and Duc Le and Jay Mahadeokar and Christian Fuegen},
journal= {arXiv preprint arXiv:2204.08858},
year = {2022}
}
备注
Accepted to SLT 2022