中文

WenetSpeech-Wu:面向统一的汉语吴方言语音处理生态系统的数据集、基准与模型

声音 2026-01-21 v1 音频与语音处理

摘要

低资源方言的语音处理仍然是开发具有包容性和鲁棒性的语音技术所面临的一项根本挑战。尽管汉语吴方言具有重要的语言学意义且使用人口众多,但长期以来一直受限于缺乏大规模语音数据、标准化评估基准和公开可用的模型。在本研究中,我们提出了 WenetSpeech-Wu,这是首个大规模、多维度标注的吴方言开源语音语料库,包含约 8000 小时的多样化语音数据。基于该数据集,我们引入了 WenetSpeech-Wu-Bench,这是首个用于系统评估吴方言语音处理的标准化公开基准,涵盖自动语音识别(ASR)、吴语至普通话翻译、说话人属性预测、语音情感识别、文本至语音(TTS)合成以及指令跟随 TTS(instruct TTS)。此外,我们发布了一系列在 WenetSpeech-Wu 上训练的强大开源模型,在多个任务上取得了具有竞争力的性能,并实证验证了所提出数据集的有效性。这些贡献共同为全面的吴方言语音处理生态系统奠定了基础,我们将所提出的数据集、基准和模型开源,以支持未来关于方言语音智能的研究。

关键词

引用

@article{arxiv.2601.11027,
  title  = {WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem},
  author = {Chengyou Wang and Mingchen Shao and Jingbin Hu and Zeyu Zhu and Hongfei Xue and Bingshen Mu and Xin Xu and Xingyi Duan and Binbin Zhang and Pengcheng Zhu and Chuang Ding and Xiaojun Zhang and Hui Bu and Lei Xie},
  journal= {arXiv preprint arXiv:2601.11027},
  year   = {2026}
}