中文

在低资源语言上微调Whisper用于实际应用

计算与语言 2025-04-23 v3 音频与语音处理

摘要

本文提出了一种新的方法,用于在低资源语言上微调OpenAI的Whisper模型,引入一种新颖的数据生成方法,将句子级数据转换为长篇文档,瑞士德语作为案例研究。句子级数据之外的数据(可提高长篇音频性能)难以获取且常受版权限制。我们的方法通过将更易获得的数据转化为格式,保留模型处理长篇音频和进行分割的能力,而无需句子级数据。我们的数据生成过程提高了几个实际应用中的性能,导致开发了一个新的狗狗级语音到文本(STT)模型,用于瑞士德语。我们将模型与非微调的Whisper和我们之前的狗狗级瑞士德语STT模型进行比较,其中我们的新模型在BLEU分数上取得更高的成绩。我们的结果还表明,所提出的方法适用于其他低资源语言,配合编写的编写指导和代码,可创建微调后的Whisper模型,保持分割能力,并仅使用句子级数据即可以高质量转录更长音频文件。

关键词

引用

@article{arxiv.2412.15726,
  title  = {Fine-tuning Whisper on Low-Resource Languages for Real-World Applications},
  author = {Vincenzo Timmel and Claudio Paonessa and Reza Kakooee and Manfred Vogel and Daniel Perruchoud},
  journal= {arXiv preprint arXiv:2412.15726},
  year   = {2025}
}