中文

百里挑一:从海量候选中选取最优预测序列用于流式语音识别

音频与语音处理 2021-04-06 v3

摘要

RNN-Transducer 与改进的基于注意力的编码器-解码器模型被广泛应用于流式语音识别。与这两种端到端模型相比,CTC 模型在训练与推理上更为高效。然而,它无法捕捉输出词符之间的语言依赖关系。受两遍端到端模型成功的启发,我们将一个 transformer 解码器与两阶段推理方法引入流式 CTC 模型。在推理时,CTC 解码器首先以流式方式生成许多候选序列;随后 transformer 解码器基于相应的声学编码状态选出最优候选。第二阶段的 transformer 解码器可视为一个条件语言模型。我们假设,第一阶段生成的足够数量且足够多样性的候选能够弥补 CTC 模型语言建模能力的不足。所有实验均在中文普通话数据集 AISHELL-1 上进行。结果表明,我们所提模型能以快速且直接的方式实现流式解码,相较基线 CTC 模型最高可降低 20% 的字符错误率。此外,该模型亦能以极小的性能损失进行非流式推理。

关键词

引用

@article{arxiv.2010.14791,
  title  = {One In A Hundred: Select The Best Predicted Sequence from Numerous Candidates for Streaming Speech Recognition},
  author = {Zhengkun Tian and Jiangyan Yi and Ye Bai and Jianhua Tao and Shuai Zhang and Zhengqi Wen},
  journal= {arXiv preprint arXiv:2010.14791},
  year   = {2021}
}