中文

利用自监督学习模型进行跨语言儿童语音成熟度分类

计算与语言 2025-06-11 v1 人工智能

摘要

语音技术系统在儿童语音的许多下游任务上表现不佳,原因在于训练语料库较小以及儿童语音带来的困难。我们将一个新数据集SpeechMaturity应用于最先进的Transformer模型,以解决一个基本分类任务:识别儿童发声。与之前的语料库不同,我们的数据集捕捉了生态有效性最大化的儿童发声,样本量前所未有,包括在美国、玻利维亚、瓦努阿图、巴布亚新几内亚、所罗门群岛和法国学习25种以上语言的儿童。该数据集包含242,004个标注的发声,规模远大于先前工作。模型被训练用于区分哭声、笑声、成熟发声(辅音+元音)和不成熟语音(仅辅音或元音)。在该数据集上训练的模型优于在先前数据集上训练的最先进模型,达到了与人类相当的分类准确率,并且在农村和城市环境中均表现出鲁棒性。

关键词

引用

@article{arxiv.2506.08999,
  title  = {Employing self-supervised learning models for cross-linguistic child speech maturity classification},
  author = {Theo Zhang and Madurya Suresh and Anne S. Warlaumont and Kasia Hitczenko and Alejandrina Cristia and Margaret Cychosz},
  journal= {arXiv preprint arXiv:2506.08999},
  year   = {2025}
}

备注

To be published in Interspeech 2025. 5 pages, 2 figures. For associated Github repository, see https://github.com/spoglab-stanford/w2v2-pro-sm/tree/main/speechbrain/recipes/W2V2-LL4300-Pro-SM