中文

基于辅助分类器 GAN 的声音信号合成——以 COVID-19 咳嗽为例

声音 2025-08-13 v1 机器学习

摘要

医疗保健是人工智能中增长最快的领域之一。鉴于其重要性,许多研究人员一直致力于将机器学习模型部署到需求日益增长的医疗保健领域,以辅助医生并提高可及性。然而,交付可靠的模型需要大量的数据,而最近的 COVID-19 大流行提醒人们医疗保健领域具有蔓延性和可怕性,这使得模型训练变得困难。为了缓解这种数据稀缺,许多已发表的工作尝试合成放射学咳嗽数据,以在相应的放射学数据上训练更好的 COVID-19 检测模型。为了适应大流行期间预期的时间敏感性,本工作专注于利用合成数据通过咳嗽声检测 COVID-19,以提高分类器的准确性。本工作首先在 Coughvid 数据集的平衡子集上训练了一个 CNN,建立了 72% 的基线分类测试准确率。本文展示了如何训练一个辅助分类 GAN(ACGAN),以有条件地生成健康和 COVID-19 咳嗽的新型合成梅尔频谱图。这些咳嗽声被用于增强 CNN 分类器的训练数据集,使其达到了 75% 的新测试准确率。本工作强调了训练中预期的混乱和不一致性,并为检测和处理此类缺陷提供了见解。

关键词

引用

@article{arxiv.2508.08892,
  title  = {Sound Signal Synthesis with Auxiliary Classifier GAN, COVID-19 cough as an example},
  author = {Yahya Sherif Solayman Mohamed Saleh and Ahmed Mohammed Dabbous and Lama Alkhaled and Hum Yan Chai and Muhammad Ehsan Rana and Hamam Mokayed},
  journal= {arXiv preprint arXiv:2508.08892},
  year   = {2025}
}