用于统一流式与非流式 ASR 的级联编码器
音频与语音处理
2020-10-29 v1 计算与语言
声音
摘要
端到端(E2E)自动语音识别(ASR)模型目前在多个基准测试上已展现出有竞争力的性能。这些模型的结构要么适用于流式模式,要么适用于非流式模式。本工作提出了级联编码器,用于构建一个可同时在这两种模式下运行的单个 E2E ASR 模型。所提出的模型由流式和非流式编码器组成。输入特征首先由流式编码器处理;非流式编码器专门在流式编码器的输出上运行。然后,单个解码器学习使用流式或非流式编码器的输出进行解码。结果表明,该模型在流式模式下运行时,实现了与独立流式模型相似的词错误率(WER),而在非流式模式下运行时,获得了 10% -- 27% 的相对提升。我们的结果还表明,所提出的方法优于现有的 E2E 两阶段模型,特别是在长语音上。
引用
@article{arxiv.2010.14606,
title = {Cascaded encoders for unifying streaming and non-streaming ASR},
author = {Arun Narayanan and Tara N. Sainath and Ruoming Pang and Jiahui Yu and Chung-Cheng Chiu and Rohit Prabhavalkar and Ehsan Variani and Trevor Strohman},
journal= {arXiv preprint arXiv:2010.14606},
year = {2020}
}