中文

GigaSpeech:一个具有 10,000 小时转写音频的演进式多领域 ASR 语料库

声音 2025-05-06 v1 计算与语言 音频与语音处理

摘要

本文介绍 GigaSpeech,一个演进式的多领域英语语音识别语料库,包含 10,000 小时适用于监督训练的高质量标注音频,以及 40,000 小时适用于半监督与无监督训练的总音频。首先从有声书、播客和 YouTube 收集约 40,000 小时转写音频,涵盖朗读与自发说话风格,以及艺术、科学、体育等多种主题。提出一种新的强制对齐与分割流程,以创建适用于语音识别训练的句级片段,并过滤掉低质量转写的片段。对于系统训练,GigaSpeech 提供 10h、250h、1000h、2500h 和 10000h 五种不同规模的子集。对于我们的 10,000 小时 XL 训练子集,在过滤/验证阶段将词错误率上限设为 4%,而对于所有其他较小训练子集,上限设为 0%。另一方面,DEV 与 TEST 评估集由专业人工转写员重新处理以确保高转写质量。我们为流行的语音识别工具包即 Athena、ESPnet、Kaldi 和 Pika 提供了基线系统。

关键词

引用

@article{arxiv.2106.06909,
  title  = {GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio},
  author = {Guoguo Chen and Shuzhou Chai and Guanbo Wang and Jiayu Du and Wei-Qiang Zhang and Chao Weng and Dan Su and Daniel Povey and Jan Trmal and Junbo Zhang and Mingjie Jin and Sanjeev Khudanpur and Shinji Watanabe and Shuaijiang Zhao and Wei Zou and Xiangang Li and Xuchen Yao and Yongqing Wang and Yujun Wang and Zhao You and Zhiyong Yan},
  journal= {arXiv preprint arXiv:2106.06909},
  year   = {2025}
}