用于混响语音识别的联合训练深度神经网络声学模型集成
计算与语言
2016-08-18 v1
摘要
远距离语音识别是一项挑战,特别是由于说话者与麦克风之间较大距离引起的混响对语音信号造成污染。为了应对真实场景中广泛的混响,我们提出了声学建模的新方法,包括深度神经网络(DNN)集成和联合训练的DNN集成。首先,建立多个DNN,每个对应于设置步骤中不同的混响时间60(RT60)。此外,DNN声学模型集成中的每个模型进一步联合训练,包括特征映射和声学建模,其中特征映射作为前端用于去混响。在测试阶段,使用最大后验(MAP)概率从DNN集成中选择两个最可能的DNN,该概率通过基于最大似然(ML)的盲RT60估计以在线方式计算,然后两个DNN的后验概率输出使用基于ML的权重作为简单平均进行组合。大量实验表明,所提方法在不同混响条件下相比传统DNN基线系统在语音识别准确率上取得了显著提升。
引用
@article{arxiv.1608.04983,
title = {Ensemble of Jointly Trained Deep Neural Network-Based Acoustic Models for Reverberant Speech Recognition},
author = {Jeehye Lee and Myungin Lee and Joon-Hyuk Chang},
journal= {arXiv preprint arXiv:1608.04983},
year = {2016}
}
备注
9 pages, 8 figures, 1 table