真实世界环境中的婴儿哭声检测
音频与语音处理
2022-02-18 v6 机器学习
声音
机器学习
摘要
大多数现有哭声检测模型均在受控环境下收集的数据上测试。因此,它们对含噪且真实生活环境的泛化能力尚不清楚。本文评估了若干成熟的机器学习方法,包括一个同时利用深度频谱与声学特征的模型。该模型能以 F1 分数 0.613(精确率:0.672,召回率:0.552)识别哭声事件,在日常真实环境哭声检测上展现出优于现有方法的外部效度。作为评估的一部分,我们收集并标注了一个新颖的婴儿哭声数据集,其编译自超过 780 小时的标注真实世界音频数据,由婴儿在家中佩戴的记录仪捕获,并已公开。我们的发现证实,在实验室数据上训练的哭声检测模型在呈现真实世界数据时表现不佳(实验室测试 F1:0.656,真实世界测试 F1:0.236),凸显了我们新数据集与模型的价值。
引用
@article{arxiv.2005.07036,
title = {Infant Crying Detection in Real-World Environments},
author = {Xuewen Yao and Megan Micheletti and Mckensey Johnson and Edison Thomaz and Kaya de Barbaro},
journal= {arXiv preprint arXiv:2005.07036},
year = {2022}
}