中文

COUGHVID 众包数据集:用于大规模咳嗽分析算法研究的语料库

声音 2021-06-24 v1 音频与语音处理

摘要

咳嗽音频信号分类已成功用于诊断多种呼吸系统疾病,并且利用机器学习(ML)提供广泛的 COVID-19 筛查引起了极大兴趣。然而,目前尚无经过验证的咳嗽声音数据库可用于训练此类 ML 模型。COUGHVID 数据集提供了超过 20,000 条众包咳嗽录音,代表了广泛的受试者年龄、性别、地理位置和 COVID-19 状态。首先,我们使用开源的咳嗽检测算法对数据集进行过滤。其次,经验丰富的肺科医生标注了超过 2,000 条录音以诊断咳嗽中存在的医学异常,从而贡献了现存最大的专家标注咳嗽数据集之一,可用于大量咳嗽音频分类任务。最后,我们确保被标注为有症状及 COVID-19 的咳嗽来自高感染率国家,且其专家标注一致。因此,COUGHVID 数据集为训练 ML 模型应对全球最紧迫的健康危机提供了丰富的咳嗽录音资源。

关键词

引用

@article{arxiv.2009.11644,
  title  = {The COUGHVID crowdsourcing dataset: A corpus for the study of large-scale cough analysis algorithms},
  author = {Lara Orlandic and Tomas Teijeiro and David Atienza},
  journal= {arXiv preprint arXiv:2009.11644},
  year   = {2021}
}

备注

11 pages, 3 figures