Whisper 在尼泊尔语上的微调
计算与语言
2024-11-20 v1 人工智能
摘要
尽管自动语音识别(ASR)模型取得了长足的进步,但为尼泊尔语等代表性不足的语言开发稳健的模型仍然是一项挑战。本研究致力于构建一个详尽且具泛化能力的数据集,随后对不同规模的 OpenAI Whisper 模型进行微调,以提高尼泊尔语的转写(语音到文本)准确率。我们利用公开可用的 ASR 数据集和自行录制的自定义数据集,涵盖多种口音、方言和说话风格,并通过数据增强进一步丰富数据集。我们的实验结果表明,在我们精选的自定义数据集上微调 Whisper 模型,可大幅降低所有规模模型的词错率(WER),这归功于在说话人年龄、性别和情感、声学环境、方言、与 Whisper 输入更兼容的密集音频片段(15-30秒)以及音频和转写的手工整理方面具有更大的数据多样性。值得注意的是,我们的方法优于在 Fleur's 数据集上训练的 Whisper 基线模型,在 small 模型上实现了高达 36.2% 的 WER 降低,在 medium 模型上降低了 23.8%。此外,我们表明数据增强在增强模型鲁棒性方面发挥着重要作用。我们的方法强调了在将 SOTA 模型适应于代表性不足的语言以开发准确的 ASR 系统时,数据集质量、多样性和增强的重要性。
引用
@article{arxiv.2411.12587,
title = {Whisper Finetuning on Nepali Language},
author = {Sanjay Rijal and Shital Adhikari and Manish Dahal and Manish Awale and Vaghawan Ojha},
journal= {arXiv preprint arXiv:2411.12587},
year = {2024}
}