中文

Multi-QuartzNet:用于语音识别的多分辨率卷积与多层特征融合

音频与语音处理 2020-11-30 v1

摘要

本文提出一种基于 Nvidia 先前 QuartzNet 模型的端到端语音识别网络。我们试图提升模型性能,并设计了三个组件:(1)多分辨率卷积模块,用多流卷积替换原始的 1D 时间-通道可分离卷积。每个流在卷积操作上具有独特的膨胀步长。(2)通道注意力模块,通过空间通道式池化计算各卷积流的注意力权重。(3)多层特征融合模块,通过全局多层特征图对各卷积块重新加权。我们的实验表明,Multi-QuartzNet 模型在 AISHELL-1 数据集上取得 6.77% 的 CER,优于原始 QuartzNet 并接近 SOTA 结果。

关键词

引用

@article{arxiv.2011.13090,
  title  = {Multi-QuartzNet: Multi-Resolution Convolution for Speech Recognition with Multi-Layer Feature Fusion},
  author = {Jian Luo and Jianzong Wang and Ning Cheng and Guilin Jiang and Jing Xiao},
  journal= {arXiv preprint arXiv:2011.13090},
  year   = {2020}
}

备注

will be presented in SLT 2021