中文

U2++:用于语音识别的统一两遍双向端到端模型

声音 2022-01-03 v3 计算与语言 音频与语音处理

摘要

用于语音识别的统一流式与非流式两遍(U2)端到端模型在流式能力、准确率、实时因子(RTF)和延迟方面已展现出优异性能。本文提出U2的增强版U2++以进一步提升准确率。U2++的核心思想是在训练时同时利用标注序列的前向与后向信息以学习更丰富的表示,并在解码时结合前向与后向预测以给出更准确的识别结果。我们还提出了一种称为SpecSub的新数据增强方法,帮助U2++模型更准确且更鲁棒。实验表明,与U2相比,U2++在训练时收敛更快、对解码方法鲁棒性更好,并在U2基础上一致获得5\% - 8\%的词错误率降低增益。在AISHELL-1实验中,我们通过U2++在非流式设定下取得4.63\%的字错误率(CER),在320ms延迟的流式设定下取得5.05\%。据我们所知,5.05\%是AISHELL-1测试集上已发表的最佳流式结果。

关键词

引用

@article{arxiv.2106.05642,
  title  = {U2++: Unified Two-pass Bidirectional End-to-end Model for Speech Recognition},
  author = {Di Wu and Binbin Zhang and Chao Yang and Zhendong Peng and Wenjing Xia and Xiaoyu Chen and Xin Lei},
  journal= {arXiv preprint arXiv:2106.05642},
  year   = {2022}
}