面向 COVID-19 检测的预训练音频模型微调:技术报告
声音
2025-11-20 v1 机器学习
音频与语音处理
摘要
本技术报告调查了预训练音频模型在 COVID-19 检测任务上的性能,使用 established benchmark 数据集。我们在 Coswara 和 COUGHVID 数据集上对 Audio-MAE 和三种 PANN 架构(CNN6、CNN10、CNN14)进行微调,评估了 intra-dataset 与 cross-dataset 的泛化性能。我们实施了严格的人口统计分层,以年龄和性别为基础,以防止模型利用年龄特征与性别特征与 COVID-19 状态之间的虚假关联。intradataset 结果显示,性能适中,Audio-MAE 在 Coswara 上取得最佳结果(0.82 AUC,0.76 F1 分数),而所有模型在 Coughvid 上表现有限(AUC 0.58-0.63)。cross-dataset 评估显示,所有模型在跨数据集上的泛化表现 severely 受损(AUC 0.43-0.68),Audio-MAE 显示强烈的性能退化(F1 分数 0.00-0.08)。我们的实验表明,人口统计分层虽然会降低 apparent 模型性能,但通过消除年龄特征和性别特征导致的性能膨胀,提供了更真实的 COVID-19 检测能力评估。此外,平衡后数据集的有限大小(1,219-2,160 样本)证明不足以支撑通常需要大量训练数据的深度学习模型。这些发现凸显了开发通用基于音频的 COVID-19 检测系统的根本挑战,并强调了对严格人口统计控制在临床上稳健模型评估中的重要性。
引用
@article{arxiv.2511.14939,
title = {Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report},
author = {Daniel Oliveira de Brito and Letícia Gabriella de Souza and Marcelo Matheus Gauy and Marcelo Finger and Arnaldo Candido Junior},
journal= {arXiv preprint arXiv:2511.14939},
year = {2025}
}
备注
11 pages