WenetSpeech-Chuan:面向方言语音处理的大规模四川话语料库及其丰富标注
计算与语言
2025-09-23 v1 声音
摘要
方言语音领域缺乏大规模开放语料数据,严重阻碍了语音技术的进步,这一挑战在广泛使用的中文四川话方言中尤为突出。为缓解这一关键缺口,我们引入 WenetSpeech-Chuan,一个由我们新近开发的 Chuan-Pipeline——面向方言语音的完整数据处理框架构建的、包含 10,000 小时、标注丰富的语料库。为便于严格评估并展示语料库的有效性,我们还发布了高质量的语音识别(ASR)和语音合成(TTS)基准数据集 WenetSpeech-Chuan-Eval,其转录经人工核查。实验表明,使用 WenetSpeech-Chuan 训练的模型在开源系统中实现了最先进的性能,并与商业服务相当。作为四川话方言最大规模的开放语料库,WenetSpeech-Chuan 不仅降低了方言语音处理研究的门槛,也在推动语音技术的公平性和减轻偏见方面发挥了关键作用。该语料库、基准、模型及数据集均可在项目页面公开获取。
引用
@article{arxiv.2509.18004,
title = {WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing},
author = {Yuhang Dai and Ziyu Zhang and Shuai Wang and Longhao Li and Zhao Guo and Tianlun Zuo and Shuiyuan Wang and Hongfei Xue and Chengyou Wang and Qing Wang and Xin Xu and Hui Bu and Jie Li and Jian Kang and Binbin Zhang and Lei Xie},
journal= {arXiv preprint arXiv:2509.18004},
year = {2025}
}
备注
4 pages, 5 figures, 4 tables