YODAS:面向音频和语音的YouTube数据集
计算与语言
2024-06-04 v1 声音
音频与语音处理
摘要
在这项研究中,我们介绍了YODAS(YouTube-Oriented Dataset for Audio and Speech),这是一个大规模的多语言数据集,目前包含来自有标签和无标签YouTube语音数据集的超过50万小时的、涵盖100多种语言的语音数据。有标签的子集,包括手动或自动字幕,有助于监督模型训练。相反,无标签的子集适用于自监督学习应用。YODAS是首个公开可用的此类规模的数据集,并在知识共享许可协议下分发。我们介绍了用于YODAS的收集方法,这有助于大规模语音数据集的构建。随后,我们对数据集中包含的语音和文本进行了全面分析。最后,我们描述了前15种语言的语音识别基线。
引用
@article{arxiv.2406.00899,
title = {YODAS: Youtube-Oriented Dataset for Audio and Speech},
author = {Xinjian Li and Shinnosuke Takamichi and Takaaki Saeki and William Chen and Sayaka Shiota and Shinji Watanabe},
journal= {arXiv preprint arXiv:2406.00899},
year = {2024}
}
备注
ASRU 2023