通过大规模伪标记提升低资源语言 ASR 能力
计算与语言
2024-08-27 v1 声音
音频与语音处理
摘要
本研究聚焦于 ASR 中低资源语言标注数据稀缺的挑战,具体针对印地语。我们探索伪标记技术,提出一种综合现有工作思想的通用框架。该框架整合了多个基础模型用于转录,以及评估器用于评估音频-文本对,实现对低资源语言的稳健伪标记。我们以新的基准 IndicYT 为验证依据,该基准包含来自多个内容类别的多样化 YouTube 音频文件。我们的发现表明,通过将来自 YouTube 的伪标记数据与现有训练数据相结合,可在 IndicYT 上显著提升性能,而不会影响外部领域基准的表现,证明了伪标记数据在提升低资源语言 ASR 能力方面的有效性。本工作开发的基准、代码和模型将公开发布。
引用
@article{arxiv.2408.14026,
title = {Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling},
author = {Kaushal Santosh Bhogale and Deovrat Mehendale and Niharika Parasa and Sathish Kumar Reddy G and Tahir Javed and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2408.14026},
year = {2024}
}