基于批归一化联合训练的DNN远场语音识别
计算与语言
2017-03-27 v1 机器学习
摘要
改善远场语音识别是实现灵活人机交互的关键一步。然而,当前技术在鲁棒性方面仍显不足,尤其是在遇到不利声学条件时。尽管近年来在语音增强和语音识别方面都取得了显著进展,但最先进技术的一个潜在局限在于,其组成的各个模块由于未经过联合训练而匹配不佳。为了解决这一问题,一种有前景的方法是将语音增强深度神经网络和语音识别深度神经网络串联起来,并像在一个更大的单一网络内那样联合更新它们的参数。不幸的是,联合训练可能很困难,因为在优化过程中语音增强系统的输出分布可能会发生显著变化。语音识别模块将不得不处理一个非平稳且未归一化的输入分布。为缓解此问题,我们提出了一种基于完全批归一化架构的联合训练方法。使用不同数据集、任务和声学条件进行的实验表明,所提出的框架显著超越了其他竞争性解决方案,尤其是在具有挑战性的环境中。
引用
@article{arxiv.1703.08471,
title = {Batch-normalized joint training for DNN-based distant speech recognition},
author = {Mirco Ravanelli and Philemon Brakel and Maurizio Omologo and Yoshua Bengio},
journal= {arXiv preprint arXiv:1703.08471},
year = {2017}
}
备注
arXiv admin note: text overlap with arXiv:1703.08002