端到端语音识别的改进正则化技术
计算与语言
2017-12-20 v1 声音
音频与语音处理
机器学习
摘要
正则化对于端到端语音模型十分重要,因为这类模型高度灵活且容易过拟合。数据增强与 dropout 在其他领域的端到端模型中对于改进性能十分重要。然而,它们在端到端语音模型中相对未被充分探索。因此,我们研究了这两种方法对于端到端可训练深度语音识别模型的有效性。我们通过随机扰动速度、音高、音量、时间对齐以及添加随机噪声来增强音频数据。我们进一步研究了将 dropout 应用于网络所有层输入时的效果。我们表明,数据增强与 dropout 的结合在 Wall Street Journal (WSJ) 和 LibriSpeech 数据集上均带来了超过 20% 的相对性能提升。我们的模型性能在这两个数据集上与其他端到端语音模型相比也具有竞争力。
引用
@article{arxiv.1712.07108,
title = {Improved Regularization Techniques for End-to-End Speech Recognition},
author = {Yingbo Zhou and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:1712.07108},
year = {2017}
}