中文

使用歌曲改善哈萨克语自动语音识别

音频与语音处理 2026-03-10 v3

摘要

开发哈萨克语等低资源语言的自动语音识别(ASR)系统受限于转录语料的稀缺。本研究探索将歌曲作为非传统但有前景的数据源用于哈萨克语ASR。我们策划了包含3,013个音频-文本对(约4.5小时)的歌曲数据集,来自195首歌曲和36位艺术家,按歌词行分割。以Whisper为基础识别器,在七种训练情形下进行微调,分别涉及歌曲、Common Voice语料库(CVC)和FLEURS,并在三个基准上进行评估:CVC、FLEURS和哈萨克语语料库2(KSC2)。结果表明,歌曲基础的微调在零样本基准之上显著改善了性能。例如,在Songs、CVC和FLEURS的混合训练下,Whisper Large-V3 Turbo在CVC上实现27.6%正常化字错率(WER),在FLEURS上实现11.8%,在KSC2上相对零样本模型实现了误差减半(39.3% vs. 81.2%)。尽管这些提升仍低于在1,100小时KSC2语料库上训练的模型,但它们表明,即使是适度的歌曲-语音混合训练,也可为低资源ASR带来实质性的适应性改进。该数据集将在Hugging Face上以受控、非商业许可证发布供研究使用。

关键词

引用

@article{arxiv.2603.00961,
  title  = {Using Songs to Improve Kazakh Automatic Speech Recognition},
  author = {Rustem Yeshpanov},
  journal= {arXiv preprint arXiv:2603.00961},
  year   = {2026}
}

备注

10 pages, 7 tables, to appear in Proceedings of the 2026 Language Resources and Evaluation Conference