中文

混合 ASR 系统中深度卷积神经网络的帧级 SpecAugment

计算与语言 2020-12-09 v1 声音 音频与语音处理

摘要

受端到端 ASR 系统的数据增强方法 SpecAugment 的启发,我们提出了一种帧级 SpecAugment 方法 (f-SpecAugment),以提升基于混合 HMM 的 ASR 系统中深度卷积神经网络 (CNN) 的性能。与话语级 SpecAugment 类似,f-SpecAugment 执行三种变换:时间形变、频率掩蔽和时间掩蔽。f-SpecAugment 并非在话语级应用这些变换,而是在训练期间将其独立地应用于每个卷积窗口。我们证明,对于基于深度 CNN 的混合模型,f-SpecAugment 比话语级 SpecAugment 更有效。我们在使用多达 25000 小时训练数据训练的 50 层自归一化深度卷积神经网络 (SNDCNN) 声学模型上评估了所提出的 f-SpecAugment。我们观察到,在四种语言的不同 ASR 任务中,f-SpecAugment 使 WER 相对降低了 0.5-4.5%。由于数据增强技术的收益往往随训练数据量的增加而递减,所报告的大规模训练对于理解 f-SpecAugment 的有效性具有重要意义。我们的实验表明,即使使用 25k 训练数据,f-SpecAugment 仍然有效。我们还证明,对于深度 CNN,f-SpecAugment 的收益近似等同于将训练数据量加倍。

关键词

引用

@article{arxiv.2012.04094,
  title  = {Frame-level SpecAugment for Deep Convolutional Neural Networks in Hybrid ASR Systems},
  author = {Xinwei Li and Yuanyuan Zhang and Xiaodan Zhuang and Daben Liu},
  journal= {arXiv preprint arXiv:2012.04094},
  year   = {2020}
}

备注

To appear in SLT 2021