基于斟酌模型的两遍端到端语音识别
音频与语音处理
2020-03-19 v1 计算与语言
声音
摘要
端到端(E2E)模型在自动语音识别(ASR)中取得了快速进展,并与传统模型相比具有竞争力。为了进一步提升质量,已有研究提出一种两遍模型,利用非流式 Listen, Attend and Spell(LAS)模型对流式假设进行重打分,同时保持合理延迟。该模型关注声学特征以对假设重打分,与一类仅使用一遍文本假设的神经过错纠正模型不同。在本工作中,我们提出使用斟酌网络同时关注声学特征和一遍假设。采用双向编码器从一遍假设中提取上下文信息。所提出的斟酌模型在 Google Voice Search(VS)任务上相较 LAS 重打分实现了 12% 的相对词错率(WER)降低,在一个专有名词测试集上降低了 23%。与大型传统模型相比,我们的最佳模型在 VS 上相对表现优 21%。在计算复杂度方面,斟酌解码器规模大于 LAS 解码器,因此在第二遍解码中需要更多计算。
引用
@article{arxiv.2003.07962,
title = {Deliberation Model Based Two-Pass End-to-End Speech Recognition},
author = {Ke Hu and Tara N. Sainath and Ruoming Pang and Rohit Prabhavalkar},
journal= {arXiv preprint arXiv:2003.07962},
year = {2020}
}