面向自动语音识别的大规模混合带宽深度神经网络声学建模
音频与语音处理
2019-07-12 v1 计算与语言
声音
摘要
在自动语音识别(ASR)中,具有不同采样率的宽带(WB)和窄带(NB)语音信号通常使用独立的声学模型。因此,混合带宽(MB)声学建模对于ASR系统部署具有重要的实际价值。在本文中,我们利用1150小时的WB数据和2300小时的NB数据,广泛研究了用于ASR的大规模MB深度神经网络声学建模。我们研究了多种MB策略,包括下采样、上采样和带宽扩展用于MB声学建模,并在来自不同应用领域的8个多样化WB和NB测试集上评估了它们的性能。为了处理大量训练数据,使用同步数据并行在多块GPU上进行了分布式训练。
引用
@article{arxiv.1907.04887,
title = {Large-Scale Mixed-Bandwidth Deep Neural Network Acoustic Modeling for Automatic Speech Recognition},
author = {Khoi-Nguyen C. Mac and Xiaodong Cui and Wei Zhang and Michael Picheny},
journal= {arXiv preprint arXiv:1907.04887},
year = {2019}
}
备注
Interspeech 2019