中文

WenetSpeech-Yue:面向语音理解与生成的大规模粤语语音语料库及多维标注

声音 2025-09-08 v2

摘要

大规模高质量语音数据集的可用性显著加速了语音理解与生成的发展。其中,自动语音识别(ASR)和语音合成(TTS)被认为是最成熟、最基础的任务。然而,粤语(粤语文)全球约有 8490 万母语使用者,有限的标注资源制约了进展,导致 ASR 和 TTS 性能不佳。为应对这一挑战,我们提出 WenetSpeech-Pipe,一个用于构建面向语音理解与生成的大规模语音语料库的集成流水线,包含六个模块:音频采集、说话人属性标注、语音质量标注、自动语音识别、文本后处理与识别器输出投票,从而实现丰富且高质量的标注。基于该流水线,我们发布 WenetSpeech-Yue——首个面向 ASR 和 TTS 的大规模粤语多维标注语音语料库,覆盖 10 个领域共 21800 小时,标注内容包括 ASR 转录、文本置信度、说话人身份、年龄、性别、语音质量分数等。我们还发布 WSYue-eval,一个全面的粤语基准,包含两个组成部分:WSYue-ASR-eval,用于评估短句和长句、代码切换以及多样声学条件下的 ASR 性能;WSYue-TTS-eval,包含基础集和覆盖集,用于标准测试和泛化测试。实验结果表明,基于 WenetSpeech-Yue 训练的模型在包括商业模型和基于大语言模型(LLM)的模型在内的最先进(SOTA)粤语 ASR 和 TTS 系统上取得了具有竞争力的结果,凸显了我们的数据集和流水线的价值。

关键词

引用

@article{arxiv.2509.03959,
  title  = {WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation},
  author = {Longhao Li and Zhao Guo and Hongjie Chen and Yuhang Dai and Ziyu Zhang and Hongfei Xue and Tianlun Zuo and Chengyou Wang and Shuiyuan Wang and Jie Li and Jian Kang and Xin Xu and Hui Bu and Binbin Zhang and Ruibin Yuan and Ziya Zhou and Wei Xue and Lei Xie},
  journal= {arXiv preprint arXiv:2509.03959},
  year   = {2025}
}