绑定与精简的 RNN-T 解码器
计算与语言
2021-09-17 v1 机器学习
声音
音频与语音处理
摘要
先前关于循环神经网络换能器(RNN-T)模型的研究表明,在某些条件下,可简化其预测网络而几乎不损失识别精度(arXiv:2003.07705 [eess.AS]、[2]、arXiv:2012.06749 [cs.CL])。这通过限制先前标签的上下文大小和/或使用更简单的层架构替代 LSTM 实现。此类改动的好处包括减小模型规模、加快推理与节能,均有益于端侧应用。本工作中,我们研究如何使 RNN-T 解码器(预测网络 + 联合网络)更小更快且不降低识别性能。我们的预测网络对输入嵌入做简单加权平均,并将其嵌入矩阵权重与联合网络输出层共享(即权重绑定,常用于语言建模 arXiv:1611.01462 [cs.LG])。该简洁设计在与额外的基于编辑的最小贝叶斯风险(EMBR)训练结合使用时,将 RNN-T 解码器从 23M 参数缩减至仅 2M,且不影响词错误率(WER)。
引用
@article{arxiv.2109.07513,
title = {Tied & Reduced RNN-T Decoder},
author = {Rami Botros and Tara N. Sainath and Robert David and Emmanuel Guzman and Wei Li and Yanzhang He},
journal= {arXiv preprint arXiv:2109.07513},
year = {2021}
}