中文

Common Voice:一个大规模多语种语音语料库

计算与语言 2020-03-09 v2 机器学习

摘要

Common Voice 语料库是一个大规模多语种的转写语音集合,旨在用于语音技术的研究与开发。Common Voice 设计用于自动语音识别(ASR),但也可用于其他领域(如语言识别)。为实现规模与可持续性,Common Voice 项目采用众包方式进行数据收集与数据验证。最新发布版本包含 29 种语言,截至 2019 年 11 月共有 38 种语言正在收集数据。迄今已有超过 50,000 人参与,共收集 2,500 小时音频。据我们所知,这是公共领域最大的用于语音识别的音频语料库,无论在小时数还是语言数上皆然。作为 Common Voice 的示例用例,我们给出使用 Mozilla 的 DeepSpeech 语音转文本工具包的语音识别实验。通过从源英语模型应用迁移学习,我们发现十二种目标语言(德语、法语、意大利语、土耳其语、加泰罗尼亚语、斯洛文尼亚语、威尔士语、爱尔兰语、布列塔尼语、鞑靼语、楚瓦什语和卡拜尔语)的平均字符错误率提升了 5.99 ± 5.48。对于这些语言中的大多数,这些是有史以来发表的首个端到端自动语音识别结果。

关键词

引用

@article{arxiv.1912.06670,
  title  = {Common Voice: A Massively-Multilingual Speech Corpus},
  author = {Rosana Ardila and Megan Branson and Kelly Davis and Michael Henretty and Michael Kohler and Josh Meyer and Reuben Morais and Lindsay Saunders and Francis M. Tyers and Gregor Weber},
  journal= {arXiv preprint arXiv:1912.06670},
  year   = {2020}
}

备注

Accepted to LREC 2020