中文

面向智能设备的极低占用端到端语音识别系统

声音 2021-07-08 v5 音频与语音处理

摘要

近年来,端到端(E2E)语音识别变得流行,因为它能将声学、发音和语言模型集成到单一神经网络中,并优于传统模型。在E2E方法中,基于注意力的模型(如Transformer)已显现出优越性。这类模型为在智能设备上部署ASR打开了大门,但它们仍受限于需要大量模型参数。我们提出了一种面向智能设备的极低占用E2E ASR系统,以在牺牲识别精度的前提下满足资源约束为目标。我们设计跨层权重共享以提高参数效率,并进一步利用包括稀疏化和量化在内的模型压缩方法,以减少内存占用并提升解码效率。我们在公开的AISHELL-1和AISHELL-2基准上评估了我们的方法。在AISHELL-2任务上,所提方法实现了超过10倍的压缩(模型大小从248MB降至24MB),代价仅为微小的性能损失(CER从6.49%降至6.92%)。

关键词

引用

@article{arxiv.2104.05784,
  title  = {Extremely Low Footprint End-to-End ASR System for Smart Device},
  author = {Zhifu Gao and Yiwu Yao and Shiliang Zhang and Jun Yang and Ming Lei and Ian McLoughlin},
  journal= {arXiv preprint arXiv:2104.05784},
  year   = {2021}
}

备注

5 pages, 2 figures, accepted by INTERSPEECH 2021