使用歌曲改善哈萨克语自动语音识别
音频与语音处理
2026-03-10 v3
摘要
开发哈萨克语等低资源语言的自动语音识别(ASR)系统受限于转录语料的稀缺。本研究探索将歌曲作为非传统但有前景的数据源用于哈萨克语ASR。我们策划了包含3,013个音频-文本对(约4.5小时)的歌曲数据集,来自195首歌曲和36位艺术家,按歌词行分割。以Whisper为基础识别器,在七种训练情形下进行微调,分别涉及歌曲、Common Voice语料库(CVC)和FLEURS,并在三个基准上进行评估:CVC、FLEURS和哈萨克语语料库2(KSC2)。结果表明,歌曲基础的微调在零样本基准之上显著改善了性能。例如,在Songs、CVC和FLEURS的混合训练下,Whisper Large-V3 Turbo在CVC上实现27.6%正常化字错率(WER),在FLEURS上实现11.8%,在KSC2上相对零样本模型实现了误差减半(39.3% vs. 81.2%)。尽管这些提升仍低于在1,100小时KSC2语料库上训练的模型,但它们表明,即使是适度的歌曲-语音混合训练,也可为低资源ASR带来实质性的适应性改进。该数据集将在Hugging Face上以受控、非商业许可证发布供研究使用。
引用
@article{arxiv.2603.00961,
title = {Using Songs to Improve Kazakh Automatic Speech Recognition},
author = {Rustem Yeshpanov},
journal= {arXiv preprint arXiv:2603.00961},
year = {2026}
}
备注
10 pages, 7 tables, to appear in Proceedings of the 2026 Language Resources and Evaluation Conference