希腊语播客语料库:利用弱监督数据为低资源语言构建竞争力语音模型
计算与语言
2024-06-24 v1 声音
音频与语音处理
摘要
为语言开发语音技术若干数字表征有限,主要挑战在于可用数据的稀缺。这一问题在大规模数据驱动模型时代更为突出。近期研究强调了利用弱监督技术扩充可用数据池的潜力。本研究我们编译了一个由 Modern Greek 播客语料构成的 800 小时语料库,并采用 Whisper large-v3 生成银色转录文本。该语料库用于微调我们的模型,以评估此方法在提升语音识别性能方面的效果。我们的分析覆盖 16 个不同的播客领域,并在 established 的 Modern Greek 数据集上进行评估。结果表明,WER 改善持续存在,与数据量和模型规模的增加相关。我们的研究确认,组装大型弱监督语料库是推进低资源语言语音技术的成本有效策略。
引用
@article{arxiv.2406.15284,
title = {The Greek podcast corpus: Competitive speech models for low-resourced languages with weakly supervised data},
author = {Georgios Paraskevopoulos and Chara Tsoukala and Athanasios Katsamanis and Vassilis Katsouros},
journal= {arXiv preprint arXiv:2406.15284},
year = {2024}
}
备注
To be presented at Interspeech 2024