大规模数据集上的 SpecAugment
音频与语音处理
2019-12-12 v1 计算与语言
机器学习
声音
摘要
近来,SpecAugment 作为一种直接作用于输入语句语谱图的自动语音识别增强方案,已证明在提升端到端网络在公开数据集上的性能方面极为有效。在本文中,我们通过研究其在 Google 多域数据集(Narayanan 等,2018)上的应用,展示了其在大规模数据集任务上的有效性。在训练声学模型时,我们通过混合经 SpecAugment 增强的原始训练数据与噪声扰动训练数据,在所有测试域上均取得改进。我们还引入了 SpecAugment 的一种改进,其根据语句长度调整时间掩码大小及/或倍数,这可能有益于大规模任务。通过使用自适应掩码,我们能够将 Listen, Attend and Spell 模型在 LibriSpeech 上的性能进一步提升至 test-clean 上 2.2% WER 与 test-other 上 5.2% WER。
引用
@article{arxiv.1912.05533,
title = {SpecAugment on Large Scale Datasets},
author = {Daniel S. Park and Yu Zhang and Chung-Cheng Chiu and Youzheng Chen and Bo Li and William Chan and Quoc V. Le and Yonghui Wu},
journal= {arXiv preprint arXiv:1912.05533},
year = {2019}
}
备注
5 pages, 3 tables; submitted to ICASSP 2020