中文

具有异步修正的动态延迟语音识别

音频与语音处理 2020-11-04 v1 声音

摘要

在本工作中,我们提出一种推理技术——异步修正,以统一流式与非流式语音识别模型。具体而言,我们通过在推理时使用任意右上下文,仅用单一模型实现动态延迟。该模型由一堆用于音频编码的卷积层组成。在推理阶段,编码器与解码器的历史状态可被异步修正,以在模型的延迟与准确率之间进行权衡。为缓解训练与推理的不匹配,我们提出一种训练技术——片段裁剪,其将输入语句随机分割为若干具有前向连接的片段。这使我们能够获得动态延迟语音识别结果,并在准确率上实现大幅提升。实验表明,我们具有异步修正的动态延迟模型相较流式模型取得了 8%–14% 的相对提升。

关键词

引用

@article{arxiv.2011.01570,
  title  = {Dynamic latency speech recognition with asynchronous revision},
  author = {Mingkun Huang and Meng Cai and Jun Zhang and Yang Zhang and Yongbin You and Yi He and Zejun Ma},
  journal= {arXiv preprint arXiv:2011.01570},
  year   = {2020}
}