中文

基于强化学习的语音增强用于鲁棒语音识别

音频与语音处理 2018-11-13 v1 声音

摘要

传统的基于深度神经网络(DNN)的语音增强(SE)方法旨在最小化增强语音与干净参考之间的均方误差(MSE)。MSE优化的模型可能不能直接提升自动语音识别(ASR)系统的性能。如果目标是最小化识别错误,则应使用识别结果来设计优化SE模型的目标函数。然而,ASR系统由声学模型和语言模型等多个单元组成,其结构通常复杂且不可微。在本研究中,我们提出采用强化学习算法基于识别结果优化SE模型。我们在普通话广播新闻语料库(MATBN)上评估了所提出的SE系统。实验结果表明,所提方法能有效改善ASR结果,在信噪比为0 dB和5 dB条件下分别实现了12.40%和19.23%的明显错误率降低。

关键词

引用

@article{arxiv.1811.04224,
  title  = {Reinforcement Learning Based Speech Enhancement for Robust Speech Recognition},
  author = {Yih-Liang Shen and Chao-Yuan Huang and Syu-Siang Wang and Yu Tsao and Hsin-Min Wang and Tai-Shih Chi},
  journal= {arXiv preprint arXiv:1811.04224},
  year   = {2018}
}

备注

Conference paper with 4 pages, reinforcement learning, automatic speech recognition, speech enhancement, deep neural network, character error rate