中文

基于采样 softmax 的 RNN-Transducer 内存高效训练

音频与语音处理 2022-04-01 v1 计算与语言

摘要

RNN-Transducer 已成为端到端自动语音识别中有前景的架构之一。尽管 RNN-Transducer 具有诸多优势,包括高准确率和利于流式处理,但其训练过程中的高内存消耗一直是开发中的关键问题。本工作中,我们提出将采样 softmax 应用于 RNN-Transducer,该方法在训练时仅需词汇表的一小部分,从而节省内存消耗。我们进一步扩展采样 softmax 以优化小批量下的内存消耗,并采用辅助 CTC 损失的分布来采样词汇以提升模型准确率。我们在 LibriSpeech、AISHELL-1 和 CSJ-APS 上给出实验结果,其中采样 softmax 大幅降低了内存消耗,且仍保持基线模型的准确率。

关键词

引用

@article{arxiv.2203.16868,
  title  = {Memory-Efficient Training of RNN-Transducer with Sampled Softmax},
  author = {Jaesong Lee and Lukas Lee and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2203.16868},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022