中文

自监督模型用于音素识别:儿童语音阅读学习的应用

声音 2025-03-07 v1 人工智能 音频与语音处理

摘要

儿童语音识别仍是研究中未得到充分发展的领域,主要due于数据匮乏(尤其是非英语语言)以及该任务的特殊困难。虽然我们在前期工作中探索了多种儿童语音识别架构,但本文聚焦于最新的自监督模型。我们首先比较了 wav2vec 2.0、HuBERT 和 WavLM 模型在法语儿童语音中的音素识别适应情况,随后选取表现最佳的 WavLM base+ 模型继续实验。进一步通过在微调儿童语音时解冻其 Transformer 块,显著提升了模型性能,使其相较于基于 Transformer+CTC 的基线模型表现大幅超越。最后我们详细研究了这两种模型在实际应用场景下的行为,表明 WavLM base+ 在各种阅读任务和噪声水平下鲁棒性更强。

关键词

引用

@article{arxiv.2503.04710,
  title  = {Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning},
  author = {Lucas Block Medin and Thomas Pellegrini and Lucile Gelin},
  journal= {arXiv preprint arXiv:2503.04710},
  year   = {2025}
}

备注

This paper was originally published in the Proceedings of Interspeech 2024. DOI: 10.21437/Interspeech.2024-1095