基于卷积神经网络与数据增强的咳嗽声学 COVID-19 诊断
声音
2026-05-21 v3 音频与语音处理
摘要
随着 COVID-19 的周期性起伏以及各国遭受其浪潮冲击,一种高效、经济且便捷的病毒诊断流程已成为当务之急。COVID-19 阳性个体甚至可能为无症状,使得诊断困难,但在感染者中,无症状者未必完全没有任何由病毒引起的症状。他们可能不像有症状者那样表现出可观察症状,但其咳嗽方式可能与未感染者不同。这些咳嗽声的差异极其微小,人耳无法辨别,但可通过基于机器学习的统计模型捕捉。本文提出一种深度学习方法,用于分析 DiCOVA 2021 挑战赛 Track 1 所提供的声学数据集,该数据集包含 COVID-19 阳性与阴性的咳嗽录音样本。为对录音进行分类以判定其属于 COVID-19 阳性或阴性,我们提出一种 ConvNet 模型。我们的模型在官方提供的盲测集上取得了 72.23% 的 AUC 分数,以实现对模型的无偏评估。结合数据增强的 ConvNet 模型进一步将 AUC-ROC 百分比从 72.23 提升至 87.07。其性能也超越 DiCOVA 2021 挑战赛基线模型 23%,从而位居 DiCOVA 2021 挑战赛排行榜首位。本文提出使用梅尔频率倒谱系数作为所提模型的特征输入。
引用
@article{arxiv.2110.06123,
title = {COVID-19 Diagnosis from Cough Acoustics using ConvNets and Data Augmentation},
author = {Saranga Kingkor Mahanta and Darsh Kaushik and Shubham Jain and Hoang Van Truong and Koushik Guha},
journal= {arXiv preprint arXiv:2110.06123},
year = {2026}
}
备注
DiCOVA, top 1st, This work has been submitted to the IEEE for possible publication