Listen, Attend and Spell
计算与语言
2015-08-21 v2 机器学习
神经与进化计算
机器学习
摘要
我们提出 Listen, Attend and Spell (LAS),一种学习将语音语句转写为字符的神经网络。不同于传统的 DNN-HMM 模型,该模型联合学习语音识别器的所有组件。我们的系统有两个组件:一个 listener 和一个 speller。listener 是一个金字塔形循环网络编码器,接受滤波器组频谱作为输入。speller 是一个基于注意力的循环网络解码器,输出字符。该网络生成字符序列,不在字符间做任何独立性假设。这是 LAS 相对于先前端到端 CTC 模型的关键改进。在 Google 语音搜索任务的一个子集上,LAS 在没有词典或语言模型的情况下实现了 14.1% 的词错误率 (WER),在对前 32 个束进行语言模型重打分后达到 10.3%。作为比较,最先进的 CLDNN-HMM 模型实现了 8.0% 的 WER。
引用
@article{arxiv.1508.01211,
title = {Listen, Attend and Spell},
author = {William Chan and Navdeep Jaitly and Quoc V. Le and Oriol Vinyals},
journal= {arXiv preprint arXiv:1508.01211},
year = {2015}
}