中文

无显式音子聚类的上下文相关声学建模

音频与语音处理 2021-04-08 v2 机器学习 声音

摘要

大词汇量自动语音识别的基于音素的声学建模利用了音素上下文。大量的上下文相关(CD)音素及其高度变化的统计特性需要进行绑定或平滑以实现鲁棒训练。通常,分类与回归树用于音素聚类,这是基于隐马尔可夫模型(HMM)系统中的标准做法。然而,该方案引入了次要训练目标,且不允许端到端训练。本文中,我们针对混合深度神经网络(DNN)/HMM提出了一种直接的音素上下文建模方法,其不依赖于任何音素聚类算法来确定HMM状态集。通过对中心音素状态及其左右上下文的联合概率进行不同分解,我们获得了一个由不同组件构成、联合训练的因子化网络。此外,网络对音素上下文的表示依赖于音素嵌入。我们提出的模型在Switchboard任务上的识别准确率与采用标准状态绑定决策树的混合模型相当,并略有超越。

关键词

引用

@article{arxiv.2005.07578,
  title  = {Context-Dependent Acoustic Modeling without Explicit Phone Clustering},
  author = {Tina Raissi and Eugen Beck and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2005.07578},
  year   = {2021}
}

备注

Proceedings of Interspeech 2020