中文

基于电视录音构建大规模日语 ASR 语料库

声音 2021-03-30 v1 计算与语言 音频与语音处理

摘要

本文提出一个新的大规模日语语音语料库,用于训练自动语音识别(ASR)系统。该语料库包含超过2000小时语音及转写文本,构建自日本电视录音及其字幕。我们在此开发了一种迭代工作流,基于传统的轻监督音频-文本对齐方法,从电视录音中提取匹配的音频与字幕片段。我们使用基于日本TEDx演讲视频构建的评估数据集评估用本语料库训练的模型,并确认其性能优于使用日语自发语音语料库(CSJ)训练的模型。实验结果显示了我们的语料库在训练ASR系统中的实用性。该语料库连同用于训练本文所报告模型的Kaldi脚本一并向公众研究社区开放。

关键词

引用

@article{arxiv.2103.14736,
  title  = {Construction of a Large-scale Japanese ASR Corpus on TV Recordings},
  author = {Shintaro Ando and Hiromasa Fujihara},
  journal= {arXiv preprint arXiv:2103.14736},
  year   = {2021}
}