中文

荷兰口语语言模型

计算与语言 2017-09-13 v1

摘要

在佛兰德斯,所有电视节目均配有字幕。然而,字幕制作过程非常耗时,若在字幕制作前提供运行于电视节目音频上的语音识别器输出,可加速该过程。自然地,若所采用的语言模型适配节目的语域与主题,该语音识别的表现将大幅提升。我们提出了若干在由佛兰德公共服务广播机构 VRT 提供的电视节目字幕上训练的语言模型。该数据收集于 STON 项目背景下,该项目旨在促进电视节目字幕制作流程。其中一个模型在所有可用数据(4600 万词符)上训练,但我们也针对特定类型的电视节目或领域/主题训练了模型。由于训练数据的缺乏,口语语言模型相当罕见。该语料库规模对于口语语料库而言相对较大(例如对比 CGN 的 900 万词),但对于语言模型而言仍相当小。因此,实践中建议将这些模型与基于书面语言训练的大型背景语言模型进行插值。这些模型可在 http://www.esat.kuleuven.be/psi/spraak/downloads/ 免费下载。

关键词

引用

@article{arxiv.1709.03759,
  title  = {Language Models of Spoken Dutch},
  author = {Lyan Verwimp and Joris Pelemans and Marieke Lycke and Hugo Van hamme and Patrick Wambacq},
  journal= {arXiv preprint arXiv:1709.03759},
  year   = {2017}
}