BabyHuBERT:面向儿童中心长期录音的多语言自监督学习说话人分割
音频与语音处理
2026-03-06 v2 机器学习
声音
摘要
以儿童为中心的日长录音对研究早期语言发展至关重要,但现有基于干净成人语音训练的语音模型因声学与语言学差异而表现不佳。我们提出 BabyHuBERT,一个在 13,000 小时多语言儿童中心录音(涵盖 40 多种语言)上训练的自监督语音模型。在说话人类型分类任务——区分目标儿童与女性成人、男性成人及其他儿童,这是分析自然语言体验的关键预处理步骤——上,BabyHuBERT-VTC 在六个语料库上取得了 52.1% 到 74.4% 的 F1 分数,始终优于 W2V2-LL4300(英语日长录音)和 HuBERT(干净成人语音)。在瓦努阿图和所罗门群岛语料上相对于 HuBERT 分别取得 13.2 和 15.9 个绝对 F1 点的显著提升,证明了其在代表性不足语言上的有效性。我们公开代码与模型,以支持在多样化语言环境中使用儿童中心录音的研究人员。
引用
@article{arxiv.2509.15001,
title = {BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings},
author = {Théo Charlot and Tarek Kunze and Maxime Poli and Alejandrina Cristia and Emmanuel Dupoux and Marvin Lavechin},
journal= {arXiv preprint arXiv:2509.15001},
year = {2026}
}
备注
5 pages, 1 figure