中文

语音识别中卷积神经网络的多帧交叉熵训练

音频与语音处理 2019-08-01 v1 计算与语言 机器学习 声音

摘要

我们为卷积神经网络声学模型引入多帧交叉熵训练(MFCE)。认识到与 RNN 类似,CNN 本质上是接受变长输入的序列模型,我们提议将语句中足够长的一部分作为 CNN 的输入,从而一次性预测多个标签,进而从多个相邻帧获得交叉熵损失信号。这在极小的边际计算成本下大幅增加了标签信息量。我们在 2000 小时 Switchboard 基准上训练后,于 hub5 和 rt02 上展示了显著的词错率(WER)改进。

关键词

引用

@article{arxiv.1907.13121,
  title  = {Multi-Frame Cross-Entropy Training for Convolutional Neural Networks in Speech Recognition},
  author = {Tom Sercu and Neil Mallinar},
  journal= {arXiv preprint arXiv:1907.13121},
  year   = {2019}
}