中文

Swedish Whispers;利用大规模语音语料库进行瑞典语语音识别

计算与语言 2025-08-15 v2 声音 音频与语音处理

摘要

这项工作展示了一套针对瑞典语微调的 Whisper 模型,该模型基于前所未有的规模和多样性数据集进行训练。对于这种中等资源语言来说,小语种语言通常在多语言训练数据集中代表性不足,因此通过微调现有的多语言模型可以实现显著的性能提升,如本工作所示。与 OpenAI 的 Whisper 在瑞典语上的评估相比,本工作在所有模型规模上均报告了整体提升。最值得注意的是,在 FLEURS、Common Voice 和 NST 的评估中,我们最佳模型与 OpenAI 的 whisper-large-v3 相比,平均词错误率(WER)降低了 47%。

关键词

引用

@article{arxiv.2505.17538,
  title  = {Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition},
  author = {Leonora Vesterbacka and Faton Rekathati and Robin Kurtz and Justyna Sikora and Agnes Toftgård},
  journal= {arXiv preprint arXiv:2505.17538},
  year   = {2025}
}

备注

Accepted at Interspeech 2025