基于 Transformer 的并行重打分用于流式端侧语音识别
音频与语音处理
2020-09-24 v3 计算与语言
摘要
端到端模型的最新进展通过采用两遍模型已超越传统模型。两遍模型为端侧语音识别提供了更优的速度-质量权衡:第一遍模型以流式方式生成假设,第二遍模型利用完整音频序列上下文对假设重新打分。第二遍模型在端到端模型质量超越传统模型方面起着关键作用。两遍模型的一个主要挑战是第二遍模型引入的计算延迟。具体而言,两遍模型的原始设计在第二遍模型中使用 LSTM,受其循环特性约束须顺序推理,因而延迟较长。本工作中,我们探索将第二遍重打分器中的 LSTM 层替换为 Transformer 层,其可并行处理整个假设序列,从而更高效地利用端侧计算资源。相较于基于 LSTM 的基线,我们提出的 Transformer 重打分器在质量提升的同时实现了超过 50% 的延迟降低。
引用
@article{arxiv.2008.13093,
title = {Parallel Rescoring with Transformer for Streaming On-Device Speech Recognition},
author = {Wei Li and James Qin and Chung-Cheng Chiu and Ruoming Pang and Yanzhang He},
journal= {arXiv preprint arXiv:2008.13093},
year = {2020}
}
备注
Proceedings of Interspeech, 2020