中文

InfantNet:用于分析婴儿发声的深度神经网络

声音 2020-05-27 v1 音频与语音处理

摘要

婴儿发声的声学分析对于语音发展研究以及声音分类应用具有重要价值。以往研究侧重于基于语音处理理论的声学特征度量,例如基于频谱与倒谱的分析。近来,端到端深度学习模型被开发出来,以原始语音信号(声学波形)作为输入,并利用卷积神经网络层基于分类任务学习语音声音的表征。我们将一种近期提出的端到端声音分类模型应用于分析大规模标注婴儿与成人发声数据库,该数据库记录于实验室外的自然环境中,对录音条件无控制。模型学习了基本分类,如婴儿与成人发声、婴儿言语相关与非言语发声、以及规范与非规范咿呀学语。模型在3至18月龄婴儿录音上训练,随着语音愈发清晰、咿呀学语愈发接近言语,分类准确率随年龄变化。仍需进一步工作来验证和探索该模型与数据集,但我们的结果表明深度学习如何可用于测量和研究语音习得与发展,并在言语病理学与婴儿监测中具有潜在应用。

关键词

引用

@article{arxiv.2005.12412,
  title  = {InfantNet: A Deep Neural Network for Analyzing Infant Vocalizations},
  author = {Mohammad K. Ebrahimpour and Sara Schneider and David C. Noelle and Christopher T. Kello},
  journal= {arXiv preprint arXiv:2005.12412},
  year   = {2020}
}