中文

语音识别中的语速学习

计算与语言 2015-06-03 v1 机器学习

摘要

在语音识别中,当语音速率(ROS)过低或过高时,常观察到性能显著下降。当前大多数应对ROS变化的方法侧重于ROS引起的语音信号动态特性变化,从而修改动态模型,例如隐马尔可夫模型(HMM)的转移概率。然而,异常的ROS不仅改变语音信号的动态特性,也改变其静态特性,因此无法仅通过修改动态模型来补偿。本文提出一种基于深度神经网络(DNN)的ROS学习方法,该方法将ROS特征作为DNN模型的输入,从而能够学习并补偿由ROS引起的频谱失真。实验结果表明,该方法对过慢和过快的语音段能提供更优性能,证明了我们的猜想,即ROS同时影响语音的动态和静态特性。此外,所提方法可与传统的HMM转移自适应方法结合,带来额外的性能提升。

关键词

引用

@article{arxiv.1506.00799,
  title  = {Learning Speech Rate in Speech Recognition},
  author = {Xiangyu Zeng and Shi Yin and Dong Wang},
  journal= {arXiv preprint arXiv:1506.00799},
  year   = {2015}
}