面向低资源语言的ASR模型构建指南:斯克奥特兰希语案例研究
计算与语言
2025-06-06 v1 音频与语音处理
摘要
为低资源语言开发语音识别(ASR)系统的有效方法是对现有的多语言端到端模型进行微调。当原始模型是在大量多语言数据上训练的时,即使该语言在原始训练数据中并未出现,微调也能在有限的训练数据下效果良好。微调方法得益于公共领域 E2E 模型的可用性,广泛认为其能实现最先进的结果。然而,本文挑战了这一信念。我们展示,结合混合 HMM 与自监督模型的方法,在有限训练数据下可实现显著更好的性能。这种组合方式通过持续的自监督预训练和半监督训练,更好地利用了所有可用的语音和文本数据。我们在斯克奥特兰希语(Scottish Gaelic)上进行基准测试,实现了相对于我们最佳微调 Whisper 模型的 32% WER 降低。
引用
@article{arxiv.2506.04915,
title = {A Practitioner's Guide to Building ASR Models for Low-Resource Languages: A Case Study on Scottish Gaelic},
author = {Ondřej Klejch and William Lamb and Peter Bell},
journal= {arXiv preprint arXiv:2506.04915},
year = {2025}
}
备注
Accepted to Interspeech 2025