中文

面向语音识别的统一流式与非流式两遍端到端模型

声音 2021-12-30 v2 计算与语言 音频与语音处理

摘要

本文提出一种新颖的两遍方法,在单一模型中统一流式与非流式端到端(E2E)语音识别。我们的模型采用混合 CTC/注意力架构,其中编码器中的 conformer 层被修改。我们提出一种基于动态分块的注意力策略,以允许任意右侧上下文长度。在推理时,CTC 解码器以流式方式生成 n-best 假设。推理延迟可通过仅改变分块大小来轻松控制。随后由注意力解码器对 CTC 假设进行重打分以获得最终结果。这一高效的重打分过程带来的句子级延迟极小。我们在公开的 170 小时 AISHELL-1 数据集上的实验表明,所提方法能够简单高效地统一流式与非流式模型。在 AISHELL-1 测试集上,与标准非流式 transformer 相比,我们的统一模型在非流式 ASR 中实现了 5.60% 的相对字符错误率(CER)降低。同一模型在流式 ASR 系统中以 640ms 延迟取得了 5.42% 的 CER。

关键词

引用

@article{arxiv.2012.05481,
  title  = {Unified Streaming and Non-streaming Two-pass End-to-end Model for Speech Recognition},
  author = {Binbin Zhang and Di Wu and Zhuoyuan Yao and Xiong Wang and Fan Yu and Chao Yang and Liyong Guo and Yaguang Hu and Lei Xie and Xin Lei},
  journal= {arXiv preprint arXiv:2012.05481},
  year   = {2021}
}