中文

Fast-U2++:联合 CTC/注意力框架下快速准确的端到端语音识别

声音 2022-11-03 v1 音频与语音处理

摘要

近来,用于语音识别的统一流式与非流式两遍(U2/U2++)端到端模型在流式能力、准确率和延迟方面表现出优异性能。本文提出 fast-U2++,即 U2++ 的增强版本,以进一步降低部分延迟。fast-U2++ 的核心思想是在其编码器底层使用小块输出部分结果,而在编码器顶层使用大块以补偿小块带来的性能下降。此外,我们使用知识蒸馏方法来降低词符发射延迟。我们在 Aishell-1 数据集上给出了大量实验。实验和消融研究表明,与 U2++ 相比,fast-U2++ 将模型延迟从 320ms 降低到 80ms,并在流式设置下取得了 5.06% 的字错误率(CER)。

关键词

引用

@article{arxiv.2211.00941,
  title  = {Fast-U2++: Fast and Accurate End-to-End Speech Recognition in Joint CTC/Attention Frames},
  author = {Chengdong Liang and Xiao-Lei Zhang and BinBin Zhang and Di Wu and Shengqiang Li and Xingchen Song and Zhendong Peng and Fuping Pan},
  journal= {arXiv preprint arXiv:2211.00941},
  year   = {2022}
}

备注

5 pages, 3 figures