关于 RNN-T 中预测网络架构在 ASR 中的研究
音频与语音处理
2022-06-30 v1 人工智能
摘要
RNN-T 模型因其在性能上的竞争力及以在线流式模式运行的能力,在文献与商业系统中日益流行。本文对单调及原始 RNN-T 模型的若干预测网络架构进行了广泛比较。我们基于一个通用的先进 Conformer 编码器比较了 4 类预测网络,并报告在 Librispeech 和内部医疗对话数据集上获得的结果。我们的研究涵盖离线批处理模式与在线流式场景。与部分先前工作相反,结果表明当与 Conformer 编码器配合作为预测网络时,Transformer 并非总是优于 LSTM。受评分结果启发,我们提出一种简单的新型预测网络架构 N-Concat,在我们的在线流式基准中优于其他架构。Transformer 与 n-gram 简化架构表现非常相似,但在先前上下文方面存在一些重要差异。总体而言,与 LSTM 基线相比,我们实现了最高 4.1% 的相对 WER 提升,同时将预测网络参数量减少近一个数量级(8.4 倍)。
引用
@article{arxiv.2206.14618,
title = {On the Prediction Network Architecture in RNN-T for ASR},
author = {Dario Albesano and Jesús Andrés-Ferrer and Nicola Ferri and Puming Zhan},
journal= {arXiv preprint arXiv:2206.14618},
year = {2022}
}
备注
To appear at Interspeech 2022