中文

WeNet 2.0:更高生产力的端到端语音识别工具包

声音 2022-07-06 v2 计算与语言 音频与语音处理

摘要

近期,我们发布了 WeNet,一个面向生产的端到端语音识别工具包,其引入了统一两遍(U2)框架和内置运行时,以在单一模型中处理流式与非流式解码模式。为进一步改善 ASR 性能并满足各类生产需求,本文提出 WeNet 2.0,包含四项重要更新。(1) 我们提出 U2++,一种带有双向注意力解码器的统一两遍框架,其通过右到左注意力解码器纳入未来上下文信息,以提升共享编码器的表征能力及重打分阶段的性能。(2) 我们在 WeNet 2.0 中引入基于 n-gram 的语言模型与基于 WFST 的解码器,促进丰富文本数据在生产场景中的使用。(3) 我们设计了统一的上下文偏置框架,利用用户特定上下文(如联系人列表)为生产提供快速适配能力,并在有 LM 与无 LM 场景下均提升 ASR 准确率。(4) 我们设计了统一 IO 以支持大规模数据的高效模型训练。总之,全新的 WeNet 2.0 在多个语料上相较原始 WeNet 取得了最高 10% 的相对识别性能提升,并提供了若干面向生产的重要特性。

关键词

引用

@article{arxiv.2203.15455,
  title  = {WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit},
  author = {Binbin Zhang and Di Wu and Zhendong Peng and Xingchen Song and Zhuoyuan Yao and Hang Lv and Lei Xie and Chao Yang and Fuping Pan and Jianwei Niu},
  journal= {arXiv preprint arXiv:2203.15455},
  year   = {2022}
}