中文

通过双通道解码适配Whisper用于流式语音识别

声音 2025-06-17 v1 音频与语音处理

摘要

OpenAI Whisper是一系列在68万小时音频上训练的鲁棒自动语音识别(ASR)模型。然而,其采用序列到序列目标训练的编码器-解码器架构缺乏对流式ASR的原生支持。在本文中,我们通过采用统一双通道(U2)结构,使用WeNet工具包对Whisper进行流式ASR微调。我们引入了一个额外的连接时序分类(CTC)解码器,该解码器使用因果注意力掩码进行训练以生成流式部分转录,而原始Whisper解码器则对这些部分输出进行重排序。我们在LibriSpeech和电话会议数据集上的实验表明,在有充分微调数据的情况下,Whisper可以被适配为强大的流式ASR模型。我们还引入了一种混合分词器方法,该方法为CTC解码器使用较小的分词空间,同时保留Whisper原始的分词空间用于注意力解码器,从而提高了数据效率和泛化能力。

关键词

引用

@article{arxiv.2506.12154,
  title  = {Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding},
  author = {Haoran Zhou and Xingchen Song and Brendan Fahy and Qiaochu Song and Binbin Zhang and Zhendong Peng and Anshul Wadhawan and Denglin Jiang and Apurv Verma and Vinay Ramesh and Srivas Prasad and Michele M. Franceschini},
  journal= {arXiv preprint arXiv:2506.12154},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025