Speech Wikimedia:一个含 77 种语言的多语种语音数据集
人工智能
2023-08-31 v1 机器学习
摘要
Speech Wikimedia 数据集是一个公开可用的音频及转写文本汇编,提取自 Wikimedia Commons。它包含来自不同场景和说话人的 1780 小时(195 GB)CC-BY-SA 许可的转写语音,涵盖 77 种不同语言。每个音频文件具有一种或多种不同语言的转写文本,使该数据集适用于训练语音识别、语音翻译和机器翻译模型。
引用
@article{arxiv.2308.15710,
title = {Speech Wikimedia: A 77 Language Multilingual Speech Dataset},
author = {Rafael Mosquera Gómez and Julián Eusse and Juan Ciro and Daniel Galvez and Ryan Hileman and Kurt Bollacker and David Kanter},
journal= {arXiv preprint arXiv:2308.15710},
year = {2023}
}
备注
Data-Centric Machine Learning Workshop at the International Machine Learning Conference 2023 (ICML)