中文

基于专家混合深度神经网络的改进ASR方法

音频与语音处理 2021-12-03 v1 计算与语言 声音

摘要

本文提出了一种用于自动语音识别(ASR)中声学模型的新型深度学习架构,称为MixNet。除常规层(如DNN-HMM中的全连接层与LSTM-HMM中的记忆单元)外,该模型使用了两个基于专家混合(MoE)的附加层。在输入处运作的第一个MoE层基于预定义的宽泛语音学类别,而在倒数第二层运作的第二个层基于自动学习的声学类别。在自然语音中,不同声学类别间分布的重叠不可避免,这导致类间误分类。若修改声学模型的常规架构使其更适于解释此类重叠,则有望提升ASR准确率。MixNet正是基于此考量开发的。通过散点图进行的分析证实,MoE确实改善了类间分离,从而转化为更好的ASR准确率。我们在大词汇量ASR任务上进行了实验,结果表明所提架构相比使用sMBR准则训练的常规模型(即DNN与LSTM)分别实现了13.6%与10.0%的词错误率相对降低。与现有用于音素分类的方法(由Eigen等人提出)相比,我们提出的方法取得了显著改进。

关键词

引用

@article{arxiv.2112.01025,
  title  = {A Mixture of Expert Based Deep Neural Network for Improved ASR},
  author = {Vishwanath Pratap Singh and Shakti P. Rath and Abhishek Pandey},
  journal= {arXiv preprint arXiv:2112.01025},
  year   = {2021}
}