中文

QuartzNet:采用一维时间-通道可分离卷积的深度自动语音识别

音频与语音处理 2019-10-24 v1

摘要

我们提出了一种用于自动语音识别的新的端到端神经声学模型。该模型由多个块组成,块间具有残差连接。每个块包含一个或多个具有一维时间-通道可分离卷积层、批归一化和ReLU层的模块。其使用CTC损失进行训练。所提出的网络在LibriSpeech和Wall Street Journal上达到了接近SOTA的准确率,同时参数量少于所有竞争模型。我们还展示了该模型可以有效地在新数据集上微调。

关键词

引用

@article{arxiv.1910.10261,
  title  = {QuartzNet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions},
  author = {Samuel Kriman and Stanislav Beliaev and Boris Ginsburg and Jocelyn Huang and Oleksii Kuchaiev and Vitaly Lavrukhin and Ryan Leary and Jason Li and Yang Zhang},
  journal= {arXiv preprint arXiv:1910.10261},
  year   = {2019}
}

备注

Submitted to ICASSP 2020