中文

CS-FLEURS:面向多语言和代码切换语音的大规模数据集

计算与语言 2025-09-18 v1 声音 音频与语音处理

摘要

我们提出 CS-FLEURS,这是一个用于开发和评估超越高资源语言的代码切换语音识别与翻译系统的新型数据集。CS-FLEURS 包含 4 个测试集,总计覆盖 113 对独特的代码切换语言对,涵盖 52 种语言:1)14 对 X-English 语言对,包含真实语音朗读的人工生成代码切换句子;2)16 对 X-English 语言对,基于生成式文本转语音;3)60 对 {阿拉伯语、普通话、印地语、西班牙语}-X 语言对,采用生成式文本转语音;4)45 对 X-English 较低资源语言对测试集,采用拼接式文本转语音。除上述四个测试集外,CS-FLEURS 还提供训练集,包含 16 对 X-English 语言对的生成式文本转语音数据,时长为 128 小时。我们希望 CS-FLEURS 能帮助拓展未来代码切换语音研究的范围。数据集链接:https://huggingface.co/datasets/byan/cs-fleurs。

关键词

引用

@article{arxiv.2509.14161,
  title  = {CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset},
  author = {Brian Yan and Injy Hamed and Shuichiro Shimizu and Vasista Lodagala and William Chen and Olga Iakovenko and Bashar Talafha and Amir Hussein and Alexander Polok and Kalvin Chang and Dominik Klement and Sara Althubaiti and Puyuan Peng and Matthew Wiesner and Thamar Solorio and Ahmed Ali and Sanjeev Khudanpur and Shinji Watanabe and Chih-Chen Chen and Zhen Wu and Karim Benharrak and Anuj Diwan and Samuele Cornell and Eunjung Yeo and Kwanghee Choi and Carlos Carvalho and Karen Rosero},
  journal= {arXiv preprint arXiv:2509.14161},
  year   = {2025}
}