面向语音识别的统一流式与非流式两遍端到端模型
声音
2021-12-30 v2 计算与语言
音频与语音处理
摘要
本文提出一种新颖的两遍方法,在单一模型中统一流式与非流式端到端(E2E)语音识别。我们的模型采用混合 CTC/注意力架构,其中编码器中的 conformer 层被修改。我们提出一种基于动态分块的注意力策略,以允许任意右侧上下文长度。在推理时,CTC 解码器以流式方式生成 n-best 假设。推理延迟可通过仅改变分块大小来轻松控制。随后由注意力解码器对 CTC 假设进行重打分以获得最终结果。这一高效的重打分过程带来的句子级延迟极小。我们在公开的 170 小时 AISHELL-1 数据集上的实验表明,所提方法能够简单高效地统一流式与非流式模型。在 AISHELL-1 测试集上,与标准非流式 transformer 相比,我们的统一模型在非流式 ASR 中实现了 5.60% 的相对字符错误率(CER)降低。同一模型在流式 ASR 系统中以 640ms 延迟取得了 5.42% 的 CER。
引用
@article{arxiv.2012.05481,
title = {Unified Streaming and Non-streaming Two-pass End-to-end Model for Speech Recognition},
author = {Binbin Zhang and Di Wu and Zhuoyuan Yao and Xiong Wang and Fan Yu and Chao Yang and Liyong Guo and Yaguang Hu and Lei Xie and Xin Lei},
journal= {arXiv preprint arXiv:2012.05481},
year = {2021}
}