中文

面向婴儿哭声分析的自监督学习

声音 2023-05-03 v1 人工智能 计算与语言 音频与语音处理

摘要

在本文中,我们探索自监督学习(SSL)用于分析一个首创的、包含逾千名新生儿临床指征的哭声录音数据库。具体而言,我们针对基于哭声的神经损伤检测以及疼痛、饥饿和不适等哭声触发因素的识别。在医疗环境中标注大型数据库昂贵且耗时,通常需要多位专家历时数年的协作。利用大量无标签音频数据学习有用表征,可降低构建鲁棒模型乃至临床解决方案的成本。在本工作中,我们实验了在大型音频数据集上对卷积神经网络进行自监督预训练。我们表明,使用 SSL 对比损失(SimCLR)的预训练在神经损伤与哭声触发因素两项任务上均显著优于有监督预训练。此外,我们展示了通过基于 SSL 的域适应利用无标签婴儿哭声可进一步提升性能。我们还表明,使用此类基于 SSL 的预训练以适应哭声,可降低整个系统对有标签数据的需求。

关键词

引用

@article{arxiv.2305.01578,
  title  = {Self-supervised learning for infant cry analysis},
  author = {Arsenii Gorin and Cem Subakan and Sajjad Abdoli and Junhao Wang and Samantha Latremouille and Charles Onu},
  journal= {arXiv preprint arXiv:2305.01578},
  year   = {2023}
}

备注

Accepted to IEEE ICASSP 2023 workshop Self-supervision in Audio, Speech and Beyond