中文

自监督语音模型在儿童语音与婴儿发音上的分析

音频与语音处理 2024-06-07 v2 声音

摘要

为理解为何自监督学习(SSL)模型在多个语音处理下游任务上经验性地取得优异性能,众多研究聚焦于分析SSL层表示在成年语音上的编码信息。有限工作探讨了预训练和微调如何影响SSL模型对儿童语音和婴儿发音的编码。在本研究中,我们通过探究两种相关下游任务来弥合这一差距:(1) 在成年人、8-10岁中老儿童以及1-4岁幼儿语音上的音素识别(PR),以及(2) 在14个月以下婴儿的嗢声、哭声和啼声分类(VC)。对于幼儿PR,微调后的SSL模型优势主要来自其学习表示老年儿童语音特征,然后适应幼儿语音特征的能力。对于婴儿VC,基于大规模家庭录音预训练的SSL模型学习利用中层的音素表示,从而提升了该任务性能。

关键词

引用

@article{arxiv.2402.06888,
  title  = {Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations},
  author = {Jialu Li and Mark Hasegawa-Johnson and Nancy L. McElwain},
  journal= {arXiv preprint arXiv:2402.06888},
  year   = {2024}
}

备注

Accepted to 2024 ICASSP Workshop of Self-supervision in Audio, Speech and Beyond (SASB)