中文

用于鲁棒声学建模的多流 CNN

音频与语音处理 2021-04-27 v2 计算与语言 声音

摘要

本文提出多流 CNN,一种用于语音识别任务中鲁棒声学建模的新颖神经网络架构。所提架构通过对多个流上的卷积神经网络应用不同膨胀率来处理具有多样时间分辨率的输入语音,从而实现鲁棒性。膨胀率选自 3 帧子采样率的倍数。每个流堆叠 TDNN-F 层(一种一维 CNN 变体),并将来自各流的输出嵌入向量拼接后投影至最终层。我们通过在不同数据集上针对 Kaldi 最佳 TDNN-F 模型展示一致的改进来验证所提多流 CNN 架构的有效性。多流 CNN 在 LibriSpeech 语料库的 test-other 集上将 WER 相对改进 12%。在来自 ASAPP 联络中心生产 ASR 系统的定制数据上,其在客户通道音频上记录了 11% 的相对 WER 提升,证明了其对真实环境数据的鲁棒性。在实时因子方面,多流 CNN 优于基线 TDNN-F 达 15%,这也表明了其在生产系统中的实用性。当与自注意力 SRU 语言模型重打分结合时,多流 CNN 助力 ASAPP 在 LibriSpeech 的 test-clean 上取得 1.75% 的最佳 WER。

关键词

引用

@article{arxiv.2005.10470,
  title  = {Multistream CNN for Robust Acoustic Modeling},
  author = {Kyu J. Han and Jing Pan and Venkata Krishna Naveen Tadala and Tao Ma and Dan Povey},
  journal= {arXiv preprint arXiv:2005.10470},
  year   = {2021}
}

备注

Accepted to ICASSP 2021