JTubeSpeech:从 YouTube 收集的用于语音识别与说话人确认的日语语音语料库
声音
2021-12-20 v1 音频与语音处理
摘要
在本文中,我们构建了一个名为“JTubeSpeech”的新日语语音语料库。尽管近期端到端学习需要大规模的语音语料库,但除英语外其他语言的开源此类语料库尚未建立。在本文中,我们描述了从 YouTube 视频和字幕构建用于语音识别和说话人确认的语料库的过程。我们的方法可以自动过滤视频和字幕,几乎不涉及语言相关处理。我们一致地采用基于连接时序分类(CTC)的技术用于自动语音识别(ASR),以及基于说话人变化的方法用于自动说话人验证(ASV)。我们构建了 1)一个超过 1300 小时数据的大规模日语 ASR 基准,以及 2)900 小时的日语 ASV 数据。
引用
@article{arxiv.2112.09323,
title = {JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification},
author = {Shinnosuke Takamichi and Ludwig Kürzinger and Takaaki Saeki and Sayaka Shiota and Shinji Watanabe},
journal= {arXiv preprint arXiv:2112.09323},
year = {2021}
}
备注
Submitted to ICASSP2022