ParCzech4Speech:源自捷克议会数据的新语音语料库
计算与语言
2025-09-09 v1
摘要
我们介绍 ParCzech4Speech 1.0,即 ParCzech 4.0 语料库的加工版本,面向语音建模任务,其最大变体包含 2,695 小时。我们将捷克议会演讲录音与官方转录文本相结合。录音经 WhisperX 和 Wav2Vec 2.0 处理以提取自动音素-文本对齐。我们的处理流程通过提取更多且对齐可靠性更高的数据,改进了 ParCzech 3.0 语音识别版本。该数据集以三种灵活变体提供:(1) 针对自动语音识别和语音合成任务进行句子分段且具有清晰边界的版本,(2) 保留跨句子原始话语流的未分段版本,(3) 用于其他可能任务进一步自定义优化的原始对齐版本。所有变体均保留原始元数据,并在宽松的 CC-BY 许可下发布。该数据集可在 LINDAT 仓库中获取,句子分段和未分段变体还额外在 Hugging Face 上提供。
引用
@article{arxiv.2509.06675,
title = {ParCzech4Speech: A New Speech Corpus Derived from Czech Parliamentary Data},
author = {Vladislav Stankov and Matyáš Kopp and Ondřej Bojar},
journal= {arXiv preprint arXiv:2509.06675},
year = {2025}
}