中文

转录、对齐与分割:为低资源语言创建语音数据集

音频与语音处理 2024-06-19 v1

摘要

本文展示了一种为语音处理任务生成训练数据的成本有效方法。首先,我们使用最先进的自动语音识别(ASR)模型对无标签语音进行转录。随后,我们将生成的转录文本与音频对齐,并对短语进行分割。我们的工作重点在于面向低资源语言的语音识别,例如乌克兰语,使用播客作为无标签语音的来源。我们发布了全新的数据集 UK-PODS,包含现代化的对话式乌克兰语。该数据集包含超过 50 小时的文本-音频配对,以及 uk-pods-conformer——一个拥有 1.21 亿参数的 ASR 模型,其在 MCV-10 和 UK-PODS 上训练,相较于公开的 uk-nvidia-citrinet 在播客上实现了 3 倍的词错误率(WER)降低,同时在 MCV-10 测试集保持相当的 WER。UK-PODS 数据集 https://huggingface.co/datasets/taras-sereda/uk-pods 以及 ASR 模型 uk-pods-conformer https://huggingface.co/taras-sereda/uk-pods-conformer 已发布在 hugging-face hub 上。

关键词

引用

@article{arxiv.2406.12674,
  title  = {Transcribe, Align and Segment: Creating speech datasets for low-resource languages},
  author = {Taras Sereda},
  journal= {arXiv preprint arXiv:2406.12674},
  year   = {2024}
}