提高低资源语言语音识别数据量的方法
声音
2025-02-10 v2 计算与语言
音频与语音处理
摘要
本研究探讨了使用众包、伪标记、高级数据预处理以及各种宽松数据源(如有声书、Common Voice、YouTube)来增加低资源语言数据 volume 的方法。虽然这些方法在高资源语言方面已被充分探索,但在低资源语言的应用仍属探索不足。以阿美尼亚语和格鲁吉亚语为案例研究,展示了语言和资源特定特征如何影响这些方法的成功程度。本工作为研究人员提供了在低资源语言中选择具有成本效益和质量导向数据集扩展策略的实用指南。来自各种数据扩展方法的关键收获表明,付费众包在成本和质量之间提供了最佳平衡,净于志愿者众包、开源有声书和未标记数据使用。消融研究显示,使用扩充后的数据集训练的模型优于现有基线,在 FastConformer 架构下,分别实现了格鲁吉亚语和阿美尼亚语的 5.73% 和 9.9% 字错误率。我们开源了阿美尼亚语和格鲁吉亚语模型,以便进一步研究和实际应用。
引用
@article{arxiv.2501.14788,
title = {Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages},
author = {Alexan Ayrapetyan and Sofia Kostandian and Ara Yeroyan and Mher Yerznkanyan and Nikolay Karpov and Nune Tadevosyan and Vitaly Lavrukhin and Boris Ginsburg},
journal= {arXiv preprint arXiv:2501.14788},
year = {2025}
}
备注
The first four authors contributed equally