基于深度学习的增强特征咳嗽检测相机
音频与语音处理
2022-06-16 v2 声音
摘要
咳嗽是 COVID-19 的典型症状。为远程检测并定位咳嗽声,本工作开发了一种基于卷积神经网络(CNN)的深度学习模型,并将其与声音相机集成以实现咳嗽声的可视化。该咳嗽检测模型是一个二分类器,输入为两秒声学特征,输出为两种推断之一(咳嗽或其他)。我们对采集的音频文件进行数据增强,以缓解类别不平衡并反映实际环境中的各种背景噪声。为有效提取咳嗽声特征,本工作利用常规特征如频谱图、梅尔尺度频谱图和梅尔频率倒谱系数(MFCC)的速度(V)与加速度(A)图对其进行增强。VGGNet、GoogLeNet 和 ResNet 被简化为二分类器,并分别命名为 V-net、G-net 和 R-net。为寻找特征与网络的最佳组合,共进行了 39 种情况的训练,并使用测试 F1 分数确认性能。最终,G-net 结合 MFCC-V-A 特征(命名为 Spectroflow,一种适用于咳嗽检测的有效声学特征)取得了 91.9% 的测试 F1 分数(测试准确率 97.2%)。训练好的咳嗽检测模型与声音相机(即利用波束成形麦克风阵列可视化声源的设备)集成。在试点测试中,该咳嗽检测相机以 90.0% 的 F1 分数(准确率 96.0%)检测到咳嗽声,并实时跟踪了相机图像中的咳嗽位置。
引用
@article{arxiv.2107.13260,
title = {Deep learning based cough detection camera using enhanced features},
author = {Gyeong-Tae Lee and Hyeonuk Nam and Seong-Hu Kim and Sang-Min Choi and Youngkey Kim and Yong-Hwa Park},
journal= {arXiv preprint arXiv:2107.13260},
year = {2022}
}
备注
28 pages, 20 figures, and 14 tables