中文

ChildMandarin:面向3-5岁幼儿的综合普通话语音数据集

声音 2025-03-20 v3 音频与语音处理

摘要

得益于 Whisper、Conformer 等模型以及 Wav2vec 2.0 和 HuBERT 等自监督框架,自动语音识别 (Automatic Speech Recognition, ASR) 系统取得了显著进展。然而,由于幼儿语音在发音、声调和语速上与成人语音存在差异,为其开发稳健的 ASR 模型仍然具有挑战性。在本文中,我们引入了一个专注于3至5岁儿童的新普通话语音数据集,以解决该领域资源稀缺的问题。该数据集包含 41.25 小时的语音及精心制作的人工转录,采集自中国各省的 397 名说话人,且性别分布均衡。我们对说话人人口统计学特征、语音时长分布和地理覆盖范围进行了全面分析。此外,我们评估了从头训练的模型(如 Conformer)以及微调的预训练模型(如 HuBERT 和 Whisper)的 ASR 性能,其中微调展现出了显著的性能提升。进一步地,我们在我们的数据集上评估了说话人确认 (Speaker Verification, SV),结果表明,尽管幼儿独特的发声特征带来了挑战,但该数据集能有效支持 ASR 和 SV 任务。该数据集是对普通话儿童语音研究的一项宝贵贡献。该数据集现已开源,可在 https://github.com/flageval-baai/ChildMandarin 免费用于所有学术目的。

关键词

引用

@article{arxiv.2409.18584,
  title  = {ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5},
  author = {Jiaming Zhou and Shiyao Wang and Shiwan Zhao and Jiabei He and Haoqin Sun and Hui Wang and Cheng Liu and Aobo Kong and Yujie Guo and Xi Yang and Yequan Wang and Yonghua Lin and Yong Qin},
  journal= {arXiv preprint arXiv:2409.18584},
  year   = {2025}
}