利用非配对语音和文本提升Whisper对低资源语言哈萨克语的识别性能
音频与语音处理
2025-05-08 v1 计算与语言
声音
摘要
Whisper和其他大规模自动语音识别模型在性能上取得了显著进展。然而,它们在许多低资源语言(如哈萨克语)上的表现并不令人满意。研究如何利用低成本数据提升Whisper在代表性不足语言上的性能具有重要意义。在本研究中,我们利用易于获取的非配对语音和文本数据,并将语言模型GPT与Whisper结合应用于哈萨克语。我们实现了转录结束(EOT)判断修改和幻觉惩罚以提升语音识别性能。进一步,我们采用解码平均token对数概率作为从无标注语音数据中选择样本的准则,并利用伪标注数据对模型进行微调以进一步提升性能。最终,我们在多次实验中实现了超过10%的绝对词错误率(WER)降低,且整个过程有望推广到其他代表性不足的语言。
引用
@article{arxiv.2408.05554,
title = {Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text},
author = {Jinpeng Li and Yu Pu and Qi Sun and Wei-Qiang Zhang},
journal= {arXiv preprint arXiv:2408.05554},
year = {2025}
}
备注
Accepted by INTERSPEECH 2024;Minor typo correction