中文

CarneliNet:用于自动语音识别的神经混合模型

音频与语音处理 2021-07-23 v1 声音

摘要

端到端自动语音识别系统通过采用越来越深的模型已取得了很高的准确率。然而,模型深度的增加伴随更大的感受野,会对流式场景下的模型性能产生负面影响。我们提出一种称为神经混合模型的替代方法。其基本思想是引入并行浅层网络混合,而非使用极深网络。为验证该想法,我们设计了CarneliNet——一种基于CTC的神经网络,由三个mega-block组成。每个mega-block由多个基于一维深度可分离卷积的并行浅层子网络构成。我们在LibriSpeech、MLS与AISHELL-2数据集上评估该模型,取得了接近基于CTC模型的state-of-the-art结果。最后,我们展示可动态重新配置并行子网络的数量,以在不重新训练的情况下满足计算需求。

关键词

引用

@article{arxiv.2107.10708,
  title  = {CarneliNet: Neural Mixture Model for Automatic Speech Recognition},
  author = {Aleksei Kalinov and Somshubra Majumdar and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2107.10708},
  year   = {2021}
}

备注

Submitted to ASRU 2021