中文

基于领域特定师生学习范式的多口音 LSTM-CTC 语音识别改进

音频与语音处理 2019-10-03 v3

摘要

非母语语音会导致自动语音识别系统性能下降。以往应对该挑战的策略包括模型自适应、口音分类结合模型选择、替换发音词典等。本研究中,我们考虑在包含美式(母语)、印度与西班牙裔口音的多口音英语数据上训练的带连接主义时序分类(CTC)代价函数的循环神经网络(RNN)。我们利用由多口音数据训练的模型中的暗知识,在教师模型与目标转录的 CTC 代价共同指导下训练学生模型。我们表明,将知识从单一 RNN-CTC 训练模型迁移至学生模型,比独立的教师模型表现更好。由于不同已训练 CTC 模型的输出未必对齐,无法简单使用 CTC 教师模型集成。为解决此问题,我们在单一多口音教师指导下训练口音特定模型,从而得到多个对齐且训练好的 CTC 模型。此外,我们在口音特定教师监督下训练学生模型,得到进一步互补的模型,其相对字符错误率(CER)较无任何教师的基线降低 +20.1%。凭借该有效的多口音模型,我们可通过将模型自适应至各口音来实现每个口音的进一步提升。使用口音特定模型输出正则化自适应过程(即 Kullback-Leibler (KL) 散度的知识蒸馏版本)相较使用通用教师模型的常规方法取得了更优性能。

关键词

引用

@article{arxiv.1809.06833,
  title  = {Advancing Multi-Accented LSTM-CTC Speech Recognition using a Domain Specific Student-Teacher Learning Paradigm},
  author = {Shahram Ghorbani and Ahmet E. Bulut and John H. L. Hansen},
  journal= {arXiv preprint arXiv:1809.06833},
  year   = {2019}
}

备注

Accepted at SLT 2018