中文

Listen, Attend and Spell

计算与语言 2015-08-21 v2 机器学习 神经与进化计算 机器学习

摘要

我们提出 Listen, Attend and Spell (LAS),一种学习将语音语句转写为字符的神经网络。不同于传统的 DNN-HMM 模型,该模型联合学习语音识别器的所有组件。我们的系统有两个组件:一个 listener 和一个 speller。listener 是一个金字塔形循环网络编码器,接受滤波器组频谱作为输入。speller 是一个基于注意力的循环网络解码器,输出字符。该网络生成字符序列,不在字符间做任何独立性假设。这是 LAS 相对于先前端到端 CTC 模型的关键改进。在 Google 语音搜索任务的一个子集上,LAS 在没有词典或语言模型的情况下实现了 14.1% 的词错误率 (WER),在对前 32 个束进行语言模型重打分后达到 10.3%。作为比较,最先进的 CLDNN-HMM 模型实现了 8.0% 的 WER。

关键词

引用

@article{arxiv.1508.01211,
  title  = {Listen, Attend and Spell},
  author = {William Chan and Navdeep Jaitly and Quoc V. Le and Oriol Vinyals},
  journal= {arXiv preprint arXiv:1508.01211},
  year   = {2015}
}