回声状态语音识别
计算与语言
2021-02-19 v1
摘要
我们提出了受回声状态网络(ESN)启发的自动语音识别(ASR)模型,其中模型中递归神经网络(RNN)层的子集被随机初始化且不被训练。我们的研究聚焦于 RNN-T 与 Conformer 模型,并表明即使解码器被完全随机化,模型质量也不会下降。此外,由于解码器无需更新,此类模型可更高效地训练。相比之下,随机化编码器会损害模型质量,表明优化编码器并为声学输入学习恰当表示对语音识别更为关键。总体而言,我们挑战了对所有组件训练 ASR 模型的常见做法,并证明基于 ESN 的模型可取得同等性能,但比完全可训练的对应模型实现更高效的训练与存储。
引用
@article{arxiv.2102.09114,
title = {Echo State Speech Recognition},
author = {Harsh Shrivastava and Ankush Garg and Yuan Cao and Yu Zhang and Tara Sainath},
journal= {arXiv preprint arXiv:2102.09114},
year = {2021}
}