低资源语言自动语音识别的多阶段微调策略
计算与语言
2024-11-08 v1 人工智能
声音
音频与语音处理
摘要
本文提出了一种新颖的多阶段微调策略,旨在利用 OpenAI 的 Whisper 模型提升低资源语言的自动语音识别(ASR)性能。在该方法中,我们旨在通过在语言相似的语言之间顺序适应模型,为数字资源有限的语言构建 ASR 模型。我们在 Malasar 语言上进行了实验,Malasar 是一种达罗毗荼语系语言,在南印度西高止山脉约有约一万使用者。Malasar 语言由于缺乏原生文字且没有数字或口语数据资源,面临技术干预的关键挑战。通过与 Wycliffe India 和 Malasar 社区成员合作,我们创建了一个口语 Malasar 语料库,并配有使用密切相关的泰米尔语文字转写。在为 Malasar 构建 ASR 模型的方法中,我们首先构建一个中间泰米尔语 ASR,利用泰米尔语标注语音较高的数据可用性。随后,该中间模型在 Malasar 数据上进行微调,使 ASR 能够在资源有限的情况下实现更有效的适应。多阶段微调策略相较于仅在 Malasar 数据上直接微调展现出显著改善,词错误率(WER)达到 51.9%,相比直接微调方法绝对降低了 4.5%。进一步通过后处理中的标点移除将 WER 降低至 47.3%,这解决了影响评估的格式不一致问题。我们的结果强调了顺序多阶段微调结合针对性后处理作为低资源语言 ASR 系统开发的可扩展策略的有效性,特别是在可以利用语言相似性来弥合训练数据差距的情况下。
引用
@article{arxiv.2411.04573,
title = {Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages},
author = {Leena G Pillai and Kavya Manohar and Basil K Raju and Elizabeth Sherly},
journal= {arXiv preprint arXiv:2411.04573},
year = {2024}
}