中文

基于TensorFlow的声学模型与Kaldi WFST解码器的集成

音频与语音处理 2019-06-27 v1 机器学习 声音

摘要

尽管Kaldi框架提供了最先进的语音识别组件,如特征提取、基于深度神经网络(DNN)的声学模型以及基于加权有限状态转换器(WFST)的解码器,但难以实现新的灵活DNN模型。相比之下,如TensorFlow之类的通用深度学习框架可利用基于张量的计算方法轻松构建各类神经网络架构,但难以将其应用于基于WFST的语音识别。在本研究中,将基于TensorFlow的声学模型与基于WFST的Kaldi解码器集成以结合两个框架。Kaldi中使用的特征与对齐被转换以便由TensorFlow模型训练,随后训练基于DNN的声学模型。在集成的Kaldi解码器中,通过后验概率查询训练好的TensorFlow模型计算,并执行束搜索以生成词格。所提一次性解码器的优势包括将各类神经网络应用于基于WFST的语音识别,以及使用基于TensorFlow的声学模型进行基于WFST的在线解码。使用RM、WSJ和LibriSpeech数据集训练的基于TensorFlow的声学模型表现出与Kaldi框架训练的模型同等的性能。

关键词

引用

@article{arxiv.1906.11018,
  title  = {Integration of TensorFlow based Acoustic Model with Kaldi WFST Decoder},
  author = {Minkyu Lim and Ji-Hwan Kim},
  journal= {arXiv preprint arXiv:1906.11018},
  year   = {2019}
}