中文

用于特征丰富音素识别的判别式分段级联模型

计算与语言 2016-08-05 v2

摘要

判别式分段模型,如分段条件随机场(SCRF)和分段结构化支持向量机(SSVM),在语音识别中通过格点重打分和第一遍解码均取得了成功。然而,这类模型解码速度慢,阻碍了计算代价高昂的特征的使用,例如分段神经网络或其他高阶特征。典型的解决方案是使用近似解码,要么在单遍解码中使用束剪枝,要么通过束剪枝生成格点后再进行第二遍解码。在这项工作中,我们研究了使用铰链损失(即分段结构化SVM)训练的判别式分段模型。我们表明,尽管当模型已经训练好时,束搜索能提供良好的近似解码性能,但它并不适合在此方法中学习重打分模型。相反,我们考虑了一种受结构化预测级联启发的方法,该方法使用最大边际剪枝来生成格点。我们利用几种代价高昂的特征类型:分段神经网络、二阶语言模型和二阶音素边界特征,获得了一个高精度的音素识别系统。

关键词

引用

@article{arxiv.1507.06073,
  title  = {Discriminative Segmental Cascades for Feature-Rich Phone Recognition},
  author = {Hao Tang and Weiran Wang and Kevin Gimpel and Karen Livescu},
  journal= {arXiv preprint arXiv:1507.06073},
  year   = {2016}
}