中文

BabAR:从音素识别到幼儿语音生产的发育度量

音频与语音处理 2026-03-06 v1

摘要

大规模研究早期语音发育仍需自动化工具,而针对幼儿语音的自动音素识别尚未得到广泛解决。基于数十年数据收集,我们构建了 TinyVox 数据集,包含超过五十万段以英语、法语、葡萄牙语、德语和西班牙语标注的幼儿发声。我们利用 TinyVox 对 BabAR进行训练,这是一个针对幼儿语音的跨语言音素识别系统。我们发现,对其进行预训练的跨语言幼儿中心长时间录音显著优于其他方法,提供 20 秒的背景音频上下文进行微调进一步提高了性能。错误分析显示,替换错误主要发生在相同的宽泛音素类别内部,表明适合进行粗粒度的发育分析。我们通过显示 BabAR 的自动语音成熟度度量与文献中所述的发育估计相吻合来验证了 BabAR。

关键词

引用

@article{arxiv.2603.05213,
  title  = {BabAR: from phoneme recognition to developmental measures of young children's speech production},
  author = {Marvin Lavechin and Elika Bergelson and Roger Levy},
  journal= {arXiv preprint arXiv:2603.05213},
  year   = {2026}
}