中文

CoughViT:用于咳嗽音频表示学习的自监督 Vision Transformer

声音 2025-08-07 v1 人工智能 音频与语音处理

摘要

医生在诊断过程中会例行检查呼吸音,这为患者气道状况提供信息。近年来,基于呼吸音的人工智能诊断系统在呼吸疾病检测方面取得了成功。这些系统是早期可及诊断的关键,这对于及时治疗至关重要。然而,标签和数据稀缺仍是关键挑战,尤其是针对新冠疫情之外的疾病,可能限制诊断性能和可靠评估。本文提出 CoughViT,这是一种用于学习通用咳嗽声表示的新型预训练框架,以增强数据有限任务中的诊断性能。为解决标签稀缺问题,我们采用掩码建模方式对特征编码器进行自监督学习。我们在三个诊断性重要的咳嗽分类任务上评估了该方法。实验结果表明,我们的方法的表示在提升下游任务性能方面,可与当前基于监督的音频表示相匹配或更优。

关键词

引用

@article{arxiv.2508.03764,
  title  = {CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning},
  author = {Justin Luong and Hao Xue and Flora D. Salim},
  journal= {arXiv preprint arXiv:2508.03764},
  year   = {2025}
}

备注

Accepted to ISWC