WeNet:面向生产的流式与非流式端到端语音识别工具包
声音
2021-12-30 v5 计算与语言
音频与语音处理
摘要
本文提出一个名为 WeNet 的开源、生产优先且生产就绪的语音识别工具包,其中实现了一种新颖的两遍方法,以在单一模型中统一流式与非流式端到端(E2E)语音识别。WeNet 的主要动机是缩小 E2E 语音识别模型的研究与生产之间的差距。WeNet 提供了一种在多个真实场景中部署 ASR 应用的高效途径,这是其与其他开源 E2E 语音识别工具包的主要区别与优势。在我们的工具包中,实现了一种新颖的两遍方法。我们的方法提出了 transformer 层的基于动态分块(chunk)的注意力策略,以允许在混合 CTC/注意力架构中修改任意右侧上下文长度。推理延迟可通过仅改变分块大小来轻松控制。随后由注意力解码器对 CTC 假设进行重打分以获得最终结果。我们在 AISHELL-1 数据集上使用 WeNet 的实验表明,相较于标准非流式 transformer,我们的模型在非流式 ASR 中实现了 5.03\% 的相对字符错误率(CER)降低。经模型量化后,我们的模型表现出合理的 RTF 与延迟。
引用
@article{arxiv.2102.01547,
title = {WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit},
author = {Zhuoyuan Yao and Di Wu and Xiong Wang and Binbin Zhang and Fan Yu and Chao Yang and Zhendong Peng and Xiaoyu Chen and Lei Xie and Xin Lei},
journal= {arXiv preprint arXiv:2102.01547},
year = {2021}
}
备注
5 pages, 2 figures, 4 tables