中文

用于快速、内存高效ASR训练的剪枝RNN-T

音频与语音处理 2022-06-28 v1 人工智能 机器学习

摘要

用于语音识别的RNN转导器(RNN-T)框架日益流行,特别是对于已部署的实时ASR系统,因为它将高精度与自然流式识别相结合。RNN-T的缺点之一是其损失函数计算相对缓慢,且可能占用大量内存。过度的GPU内存使用使得在词汇量很大的情况下使用RNN-T损失变得不切实际:例如,对于基于汉字的ASR。我们引入了一种更快且更内存高效的RNN-T损失计算方法。我们首先使用一个在编码器和解码器嵌入上线性的简单joiner网络获得RNN-T递归的剪枝界;我们可以在不使用太多内存的情况下评估它。然后我们使用这些剪枝界来评估完整的非线性joiner网络。

关键词

引用

@article{arxiv.2206.13236,
  title  = {Pruned RNN-T for fast, memory-efficient ASR training},
  author = {Fangjun Kuang and Liyong Guo and Wei Kang and Long Lin and Mingshuang Luo and Zengwei Yao and Daniel Povey},
  journal= {arXiv preprint arXiv:2206.13236},
  year   = {2022}
}