中文

构建用于英语会话语音识别的竞争性直接声学到词模型

计算与语言 2017-12-11 v1 人工智能 神经与进化计算 机器学习

摘要

相较于使用音素、字符或上下文相关隐马尔可夫模型状态的常规子词自动语音识别模型,端到端范式中的直接声学到词(A2W)模型受到越来越多关注。这是因为 A2W 模型无需任何解码器、发音词典或外部训练的语言模型即可从语音中识别词,使得此类模型的训练与解码十分简便。先前工作表明,A2W 模型需要数量级更多的训练数据才能与常规模型性能相当。我们使用英语 Switchboard-Fisher 数据集时也显示了这一准确率差距。本文描述了一套训练 A2W 模型的方案,可缩小该差距并达到最先进的子词模型水平。我们在 Hub5-2000 Switchboard/CallHome 测试集上取得了 8.8%/13.9% 的词错误率,且未使用任何解码器或语言模型。我们发现模型初始化、训练数据顺序与正则化对 A2W 模型性能影响最大。接下来,我们提出一种联合词-字符 A2W 模型,其学习先拼写该词再识别它。该模型为用户提供丰富输出而非简单词假设,使其在训练期间未见过或极少见的词情形下尤为有用。

关键词

引用

@article{arxiv.1712.03133,
  title  = {Building competitive direct acoustics-to-word models for English conversational speech recognition},
  author = {Kartik Audhkhasi and Brian Kingsbury and Bhuvana Ramabhadran and George Saon and Michael Picheny},
  journal= {arXiv preprint arXiv:1712.03133},
  year   = {2017}
}

备注

Submitted to IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2018