中文

FT Speech:丹麦议会语音语料库

计算与语言 2020-10-29 v2 机器学习 声音 音频与语音处理

摘要

本文介绍了 FT Speech,一个由丹麦议会(亦称 Folketing,FT)会议录音创建的新语音语料库。该语料库包含超过 1800 小时的转写语音,来自共计 434 位说话人。在时长、词汇量及自发语音数量上,它均显著大于现有的丹麦公共语音语料库,后者大体局限于朗读与听写数据。我们概述了设计考量,包括预处理方法与对齐流程。为评估语料库质量,我们在该新资源上训练自动语音识别系统,并将其与在 Språkbanken 的丹麦部分(迄今最大的丹麦公共 ASR 语料库)上训练的系统进行比较。我们的基线结果显示在新语料库上取得了 14.01 的 WER。FT Speech 与领域内语言数据的结合提供了可与专门在 Språkbanken 上训练的模型相媲美的结果,表明 FT Speech 能很好地迁移至该数据集。有趣的是,我们的结果表明反之则不成立。这说明 FT Speech 为促进针对更自发语音的丹麦语 ASR 研究提供了宝贵资源。

关键词

引用

@article{arxiv.2005.12368,
  title  = {FT Speech: Danish Parliament Speech Corpus},
  author = {Andreas Kirkedal and Marija Stepanović and Barbara Plank},
  journal= {arXiv preprint arXiv:2005.12368},
  year   = {2020}
}

备注

Accepted at Interspeech 2020