中文

神经换能器训练:以样本级计算降低内存消耗

计算与语言 2023-03-14 v2 声音 音频与语音处理

摘要

神经换能器是一种用于自动语音识别(ASR)的端到端模型。虽然该模型非常适合流式 ASR,但其训练过程仍然具有挑战性。在训练期间,内存需求可能迅速超出最先进 GPU 的容量,从而限制批大小与序列长度。在本工作中,我们分析了一个典型换能器训练设置的时间与空间复杂度。我们提出了一种内存高效的训练方法,该方法逐个样本地计算换能器损失与梯度。我们给出了一些优化措施,以提高样本级方法的效率与并行性。在一组详尽的基准测试中,我们表明我们的样本级方法显著降低了内存使用,并且与默认的批处理计算相比具有有竞争力的速度。作为亮点,我们仅使用 6 GB 内存,就成功计算了批大小为 1024、音频长度为 40 秒的换能器损失与梯度。

关键词

引用

@article{arxiv.2211.16270,
  title  = {Neural Transducer Training: Reduced Memory Consumption with Sample-wise Computation},
  author = {Stefan Braun and Erik McDermott and Roger Hsiao},
  journal= {arXiv preprint arXiv:2211.16270},
  year   = {2023}
}

备注

5 pages, 4 figures, 1 table, 1 algorithm