中文

用于语音识别的 CTC 与段级 CRF 多任务学习

计算与语言 2017-06-07 v4

摘要

段级条件随机场 (SCRF) 和连接ist时序分类 (CTC) 是两种用于语音识别模型端到端训练的序列标注方法。这两种模型均通过对潜在分割备选方案的决策进行边缘化来导出序列概率,从而定义转录概率:前者使用段标签与时长的全局归一化联合模型,而后者将每一帧分类为输出符号或前一标签的“延续”。在本文中,我们通过优化 SCRF 与 CTC 损失之间的插值来训练识别模型,其中相同的循环神经网络 (RNN) 编码器用于为两个输出提取特征。我们发现,当使用 SCRF 或 CTC 模型进行解码时,这种多任务目标提高了识别准确率。此外,我们表明 CTC 也可用于预训练 RNN 编码器,从而提高学习联合模型时的收敛速率。

关键词

引用

@article{arxiv.1702.06378,
  title  = {Multitask Learning with CTC and Segmental CRF for Speech Recognition},
  author = {Liang Lu and Lingpeng Kong and Chris Dyer and Noah A. Smith},
  journal= {arXiv preprint arXiv:1702.06378},
  year   = {2017}
}

备注

5 pages, 2 figures, camera ready version at Interspeech 2017