WenetSpeech:一个 10000+ 小时多领域普通话语音识别语料库
声音
2022-02-24 v5 计算与语言
摘要
本文提出 WenetSpeech,一个多领域普通话语料库,包含 10000+ 小时高质量标注语音、2400+ 小时弱标注语音以及约 10000 小时无标注语音,总计 22400+ 小时。我们从 YouTube 和 Podcast 收集数据,涵盖多种说话风格、场景、领域、话题及噪声条件。引入一种基于光学字符识别(OCR)的方法,为其对应视频字幕的 YouTube 数据生成音频/文本分割候选,同时使用高质量 ASR 转写系统为 Podcast 数据生成音频/文本对候选。随后我们提出一种新颖的端到端标注错误检测方法,以进一步验证和过滤候选。我们还随 WenetSpeech 提供三套人工标注的高质量测试集用于评估——Dev 用于训练中的交叉验证,Test_Net 从互联网收集用于匹配测试,以及 Test_Meeting 从真实会议录制用于更具挑战性的不匹配测试。我们给出了使用 WenetSpeech 训练的三种流行语音识别工具包(即 Kaldi、ESPnet 和 WeNet)的基线系统,并提供了在这三套测试集上的识别结果作为基准。据我们所知,WenetSpeech 是当前最大的带转写的开源普通话语音语料库,有益于生产级语音识别的研究。
引用
@article{arxiv.2110.03370,
title = {WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition},
author = {Binbin Zhang and Hang Lv and Pengcheng Guo and Qijie Shao and Chao Yang and Lei Xie and Xin Xu and Hui Bu and Xiaoyu Chen and Chenchen Zeng and Di Wu and Zhendong Peng},
journal= {arXiv preprint arXiv:2110.03370},
year = {2022}
}