中文

挪威议会语音语料库

计算与语言 2023-02-08 v1 声音 音频与语音处理

摘要

挪威议会语音语料库(NPSC)是一个包含挪威议会 Stortinget 会议录音的语音数据集。它是首个公开可用、包含为非脚本挪威语语音且为训练自动语音识别(ASR)系统而设计的语料库。录音经人工转写并标注语言代码与说话人,且含有关于说话人的详细元数据。转写存在规范与非规范两种形式,非标准词被显式标记并标注标准等价词。为测试该数据集的效用,我们将一个在 NPSC 上训练的 ASR 系统与仅在文稿朗读语音上训练的基线系统比较。这些系统在包含自发方言语音的独立数据集上测试。NPSC 训练的系统表现显著更优,词错误率(WER)相对提升 22.9%。此外,在 NPSC 上训练显示出方言上的“民主化”效应,因为基线系统 WER 较高的方言其改进通常更大。

关键词

引用

@article{arxiv.2201.10881,
  title  = {The Norwegian Parliamentary Speech Corpus},
  author = {Per Erik Solberg and Pablo Ortiz},
  journal= {arXiv preprint arXiv:2201.10881},
  year   = {2023}
}

备注

6 pages, submitted to LREC 2022