中文

Whale:结合 w2v-BERT 与 E-Branchformer 及大规模语音数据的大规模多语言 ASR 模型

计算与语言 2025-06-03 v1 音频与语音处理

摘要

本文报告了大规模语音识别模型 Whale 的开发过程。与 Whisper 和 OWSM 等模型类似,Whale 利用了庞大的模型规模和多样化、广泛的数据集。Whale 的架构集成了 w2v-BERT 自监督模型、基于 E-Branchformer 构建的编码器-解码器主干,以及联合 CTC-注意力解码策略。训练语料库包含多种语音数据,不仅有公开语料库,还包括内部数据,从而增强了模型对不同说话风格和声学条件的鲁棒性。通过在多个基准上进行评估,Whale 取得了与现有模型相当的性能。特别地,它在 Librispeech test-clean 集上实现了 2.4% 的词错误率,在 CSJ eval3 集上实现了 3.4% 的字符错误率,优于 Whisper large-v3 和 OWSM v3.1。

关键词

引用

@article{arxiv.2506.01439,
  title  = {Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data},
  author = {Yosuke Kashiwagi and Hayato Futami and Emiru Tsunoo and Satoshi Asakawa},
  journal= {arXiv preprint arXiv:2506.01439},
  year   = {2025}
}