中文

基于深度互学习端到端自动语音识别

计算与语言 2021-02-17 v1 机器学习

摘要

本文首次将深度互学习(DML)应用于端到端ASR模型。在DML中,多个模型在整个训练过程中通过相互模仿而同时且协作地训练,这有助于达到全局最优并防止模型做出过度自信的预测。先前的研究将DML应用于简单的多类分类问题,尚无研究将其用于更复杂的序列到序列映射问题。为此,本文提出一种将DML应用于最先进的基于Transformer的端到端ASR模型的方法。具体而言,我们提出将DML与近期具代表性的训练技术相结合,即标签平滑(label smoothing)、计划采样(scheduled sampling)和SpecAugment,这些对于强大的端到端ASR模型均是必不可少的。我们预期这些训练技术能与DML良好协作,因为DML具有互补特性。我们在两种日语ASR任务设置下进行了实验:大规模建模与紧凑建模。我们证明,与包括知识蒸馏(knowledge distillation)在内的常规学习方法相比,DML改善了两种建模设置的ASR性能。我们还表明,将DML与现有训练技术结合能有效提升ASR性能。

关键词

引用

@article{arxiv.2102.08154,
  title  = {End-to-End Automatic Speech Recognition with Deep Mutual Learning},
  author = {Ryo Masumura and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Takanori Ashihara},
  journal= {arXiv preprint arXiv:2102.08154},
  year   = {2021}
}

备注

Accepted at Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), 2020, pp.632-637