混合 ASR 系统中深度卷积神经网络的帧级 SpecAugment
计算与语言
2020-12-09 v1 声音
音频与语音处理
摘要
受端到端 ASR 系统的数据增强方法 SpecAugment 的启发,我们提出了一种帧级 SpecAugment 方法 (f-SpecAugment),以提升基于混合 HMM 的 ASR 系统中深度卷积神经网络 (CNN) 的性能。与话语级 SpecAugment 类似,f-SpecAugment 执行三种变换:时间形变、频率掩蔽和时间掩蔽。f-SpecAugment 并非在话语级应用这些变换,而是在训练期间将其独立地应用于每个卷积窗口。我们证明,对于基于深度 CNN 的混合模型,f-SpecAugment 比话语级 SpecAugment 更有效。我们在使用多达 25000 小时训练数据训练的 50 层自归一化深度卷积神经网络 (SNDCNN) 声学模型上评估了所提出的 f-SpecAugment。我们观察到,在四种语言的不同 ASR 任务中,f-SpecAugment 使 WER 相对降低了 0.5-4.5%。由于数据增强技术的收益往往随训练数据量的增加而递减,所报告的大规模训练对于理解 f-SpecAugment 的有效性具有重要意义。我们的实验表明,即使使用 25k 训练数据,f-SpecAugment 仍然有效。我们还证明,对于深度 CNN,f-SpecAugment 的收益近似等同于将训练数据量加倍。
引用
@article{arxiv.2012.04094,
title = {Frame-level SpecAugment for Deep Convolutional Neural Networks in Hybrid ASR Systems},
author = {Xinwei Li and Yuanyuan Zhang and Xiaodan Zhuang and Daben Liu},
journal= {arXiv preprint arXiv:2012.04094},
year = {2020}
}
备注
To appear in SLT 2021