基于采样 softmax 的 RNN-Transducer 内存高效训练
音频与语音处理
2022-04-01 v1 计算与语言
摘要
RNN-Transducer 已成为端到端自动语音识别中有前景的架构之一。尽管 RNN-Transducer 具有诸多优势,包括高准确率和利于流式处理,但其训练过程中的高内存消耗一直是开发中的关键问题。本工作中,我们提出将采样 softmax 应用于 RNN-Transducer,该方法在训练时仅需词汇表的一小部分,从而节省内存消耗。我们进一步扩展采样 softmax 以优化小批量下的内存消耗,并采用辅助 CTC 损失的分布来采样词汇以提升模型准确率。我们在 LibriSpeech、AISHELL-1 和 CSJ-APS 上给出实验结果,其中采样 softmax 大幅降低了内存消耗,且仍保持基线模型的准确率。
引用
@article{arxiv.2203.16868,
title = {Memory-Efficient Training of RNN-Transducer with Sampled Softmax},
author = {Jaesong Lee and Lukas Lee and Shinji Watanabe},
journal= {arXiv preprint arXiv:2203.16868},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022