中文

面向设备端流式语音识别的轻量级高效标点和词大小写预测模型

计算与语言 2024-07-19 v1 机器学习 声音 音频与语音处理

摘要

标点符号和词大小写预测是自动语音识别(ASR)中必不可少的环节。随着面向设备端的端到端流式ASR系统的普及,设备端的标点和词大小写预测已成为必要,但目前缺乏相关讨论。尽管Transformer模型已被用于此场景,但Transformer模型对设备端ASR系统而言过大。本文提出一种轻量级高效模型,能够实时联合预测标点和词大小写。该模型基于卷积神经网络(CNN)和双向长短期记忆网络(BiLSTM)。在IWSLT2011测试集上的实验结果表明,所提模型相较于最佳非Transformer模型在整体F1分数上提升了9%。相对于代表性的Transformer模型,所提模型虽仅为其1/40的规模,但实现了相当于代表模型的性能,且推理速度快2.5倍。模型适用于设备端流式ASR系统。我们的代码已公开。

关键词

引用

@article{arxiv.2407.13142,
  title  = {A light-weight and efficient punctuation and word casing prediction model for on-device streaming ASR},
  author = {Jian You and Xiangfeng Li},
  journal= {arXiv preprint arXiv:2407.13142},
  year   = {2024}
}