中文

流式联合语音识别与不流畅检测

计算与语言 2023-05-12 v2 声音 音频与语音处理

摘要

不流畅检测主要以流水线方式解决,作为语音识别的后处理。在本研究中,我们提出基于 Transformer 的编码器-解码器模型,以流式方式联合解决语音识别与不流畅检测。与流水线方法相比,联合模型可利用声学信息,使不流畅检测对识别错误具有鲁棒性,并提供非语言线索。此外,联合建模带来低延迟与轻量推理。我们研究了两种用于流式不流畅检测的联合模型变体:一种转录增强模型与一种多任务模型。转录增强模型在带有标示不流畅部分起止点的特殊标签的文本上训练。然而,它存在由额外不流畅标签引起的延迟与标准语言模型适配问题。我们提出一种多任务模型来解决此类问题,该模型在 Transformer 解码器上具有两个输出层:一个用于语音识别,另一个用于不流畅检测。其建模为以当前已识别词符为条件,并带有额外的词符依赖机制。我们表明,所提出的联合模型在 Switchboard 和日语自发语料库上,于准确率和延迟方面均优于基于 BERT 的流水线方法。

关键词

引用

@article{arxiv.2211.08726,
  title  = {Streaming Joint Speech Recognition and Disfluency Detection},
  author = {Hayato Futami and Emiru Tsunoo and Kentaro Shibata and Yosuke Kashiwagi and Takao Okuda and Siddhant Arora and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2211.08726},
  year   = {2023}
}

备注

Accepted at ICASSP2023