Google 众包语音语料库及相关的低资源语言与方言开源资源:综述
计算与语言
2020-10-15 v1
摘要
本文综述了一个旨在满足为代表性不足语言开发自由可用语音资源日益增长需求的计划。目前我们已发布 38 个数据集,用于为南亚、东南亚、非洲、欧洲和南美洲的语言及方言构建文本转语音和自动语音识别应用。本文描述了开发此类语料库的方法,并提出了一些可惠及代表性不足语言社区的研究发现。
引用
@article{arxiv.2010.06778,
title = {Google Crowdsourced Speech Corpora and Related Open-Source Resources for Low-Resource Languages and Dialects: An Overview},
author = {Alena Butryna and Shan-Hui Cathy Chu and Isin Demirsahin and Alexander Gutkin and Linne Ha and Fei He and Martin Jansche and Cibu Johny and Anna Katanova and Oddur Kjartansson and Chenfang Li and Tatiana Merkulova and Yin May Oo and Knot Pipatsrisawat and Clara Rivera and Supheakmungkol Sarin and Pasindu de Silva and Keshan Sodimana and Richard Sproat and Theeraphol Wattanavekin and Jaka Aris Eko Wibawa},
journal= {arXiv preprint arXiv:2010.06778},
year = {2020}
}
备注
Appeared in 2019 UNESCO International Conference Language Technologies for All (LT4All): Enabling Linguistic Diversity and Multilingualism Worldwide, 4-6 December, Paris, France