Libriheavy:一个带标点、大小写与上下文的 50,000 小时 ASR 语料库
音频与语音处理
2024-01-17 v2 声音
摘要
在本文中,我们介绍 Libriheavy,一个由 LibriVox 衍生的 50,000 小时英语朗读语音组成的大规模 ASR 语料库。据我们所知,Libriheavy 是规模最大的带有监督信息且自由可用的语音语料库。与其他仅提供规范化转录的开源数据集不同,Libriheavy 包含更丰富的信息,如标点、大小写和文本上下文,这为系统构建带来了更大灵活性。具体而言,我们提出一个通用且高效的流程,将先前发布的 Librilight 中的音频定位、对齐并切分至其对应文本。与 Librilight 相同,Libriheavy 也拥有 small、medium、large 三个训练子集,规模分别为 500h、5000h、50000h。我们还从对齐音频中提取了开发集与测试评估集,并保证训练集中无重叠说话人与书籍。基线系统基于流行的 CTC-Attention 与 transducer 模型构建。此外,我们开源了数据集创建流程,该流程亦可应用于其他音频对齐任务。
关键词
引用
@article{arxiv.2309.08105,
title = {Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context},
author = {Wei Kang and Xiaoyu Yang and Zengwei Yao and Fangjun Kuang and Yifan Yang and Liyong Guo and Long Lin and Daniel Povey},
journal= {arXiv preprint arXiv:2309.08105},
year = {2024}
}
备注
Submitted to ICASSP 2024