用于特征丰富音素识别的判别式分段级联模型
计算与语言
2016-08-05 v2
摘要
判别式分段模型,如分段条件随机场(SCRF)和分段结构化支持向量机(SSVM),在语音识别中通过格点重打分和第一遍解码均取得了成功。然而,这类模型解码速度慢,阻碍了计算代价高昂的特征的使用,例如分段神经网络或其他高阶特征。典型的解决方案是使用近似解码,要么在单遍解码中使用束剪枝,要么通过束剪枝生成格点后再进行第二遍解码。在这项工作中,我们研究了使用铰链损失(即分段结构化SVM)训练的判别式分段模型。我们表明,尽管当模型已经训练好时,束搜索能提供良好的近似解码性能,但它并不适合在此方法中学习重打分模型。相反,我们考虑了一种受结构化预测级联启发的方法,该方法使用最大边际剪枝来生成格点。我们利用几种代价高昂的特征类型:分段神经网络、二阶语言模型和二阶音素边界特征,获得了一个高精度的音素识别系统。
引用
@article{arxiv.1507.06073,
title = {Discriminative Segmental Cascades for Feature-Rich Phone Recognition},
author = {Hao Tang and Weiran Wang and Kevin Gimpel and Karen Livescu},
journal= {arXiv preprint arXiv:1507.06073},
year = {2016}
}