中文

大规模自动语音识别中单调换能器的研究

音频与语音处理 2022-10-25 v2 声音

摘要

流式端到端自动语音识别(ASR)中最常用的两种损失函数是 RNN-Transducer(RNN-T)和连接时序分类(CTC)。在这两类损失之间,我们可以归类出单调 RNN-T(MonoRNN-T)和最近提出的类 CTC 换能器(CTC-T)。单调换能器有几个优点。首先,RNN-T 可能遭受失控幻觉,即模型在不随时间推进的情况下持续输出非空白符号。其次,单调换能器每个时间步恰好消耗一个模型分数,因此与传统基于 FST 的 ASR 解码器更兼容。然而,迄今为止发现 MonoRNN-T 的准确率比 RNN-T 差。事情未必如此:通过联合 LAS 训练或从 RNN-T 进行参数初始化来正则化训练,MonoRNN-T 和 CTC-T 的表现都与 RNN-T 相当或更好。这一点在 LibriSpeech 和一个大规模内部数据集上得到了证明。

关键词

引用

@article{arxiv.2204.08858,
  title  = {An Investigation of Monotonic Transducers for Large-Scale Automatic Speech Recognition},
  author = {Niko Moritz and Frank Seide and Duc Le and Jay Mahadeokar and Christian Fuegen},
  journal= {arXiv preprint arXiv:2204.08858},
  year   = {2022}
}

备注

Accepted to SLT 2022