GigaSpeech 2:面向低资源语言的、具有自动爬取、转录和精炼功能的演进式大规模多领域 ASR 语料库
音频与语音处理
2025-05-28 v2 计算与语言
声音
摘要
语音技术的发展得益于数据集规模的迅速增长。传统的语音模型通常依赖于大量有标签的训练数据,而这对于低资源语言来说是稀缺的。本文介绍了 GigaSpeech 2,一个大规模、多领域、多语言的语音识别语料库。它专为低资源语言设计,不依赖于配对的语音和文本数据。GigaSpeech 2 包含约 30,000 小时的自动转录语音,包括泰语、印度尼西亚语和越南语,这些数据来自未标记的 YouTube 视频。我们还引入了一个用于数据爬取、转录和标签精炼的自动化流水线。具体来说,该流水线涉及用于初始转录的 Whisper、用于强制对齐的 MMS 以及用于数据质量保证的多维过滤。我们开发了一种改进的 Noisy Student Training 方法,以迭代方式进一步精炼有缺陷的伪标签,从而提升模型性能。在我们手动转录的评估集以及来自 Common Voice 和 FLEURS 的两个公开测试集上的实验结果证实了我们语料库的高质量和广泛适用性。值得注意的是,在具有挑战性和现实性的 YouTube 测试集上,使用 GigaSpeech 2 训练的 ASR 模型与 Whisper large-v3 相比,可以将泰语、印度尼西亚语和越南语的词错误率降低 25% 到 40%,而模型参数仅为后者的 10%。此外,我们使用 GigaSpeech 2 训练的 ASR 模型性能优于商业服务。我们希望我们新引入的语料库和流水线将为低资源语音识别开辟一条新途径,并极大地促进该领域的研究。
引用
@article{arxiv.2406.11546,
title = {GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement},
author = {Yifan Yang and Zheshu Song and Jianheng Zhuo and Mingyu Cui and Jinpeng Li and Bo Yang and Yexing Du and Ziyang Ma and Xunying Liu and Ziyuan Wang and Ke Li and Shuai Fan and Kai Yu and Wei-Qiang Zhang and Guoguo Chen and Xie Chen},
journal= {arXiv preprint arXiv:2406.11546},
year = {2025}
}
备注
Accepted in ACL 2025 (Main)