中文

用于 COVID-19 的大规模且经 PCR 参考的语音音频数据集

声音 2023-11-06 v4 机器学习 音频与语音处理

摘要

英国 COVID-19 语音音频数据集旨在用于训练和评估利用语音音频对 SARS-CoV-2 感染状态或相关呼吸道症状进行分类的机器学习模型。英国卫生安全局在 2021 年 3 月至 2022 年 3 月期间,通过英格兰的国家检测与追踪计划以及 REACT-1 调查招募了自愿参与者,此期间 Alpha 与 Delta SARS-CoV-2 变异株以及部分 Omicron 变异株亚系占主导传播。在“发声助力战胜冠状病毒”数字调查中收集了有意咳嗽、呼气和语音的音频录音,同时收集了人口统计学、自我报告症状与呼吸道疾病数据,并与 SARS-CoV-2 检测结果相关联。英国 COVID-19 语音音频数据集是迄今最大的经 SARS-CoV-2 PCR 参考的音频录音集合。PCR 结果与 72,999 名参与者中的 70,794 名以及 25,776 例阳性中的 24,155 例相关联。45.62% 的参与者报告了呼吸道症状。该数据集在生物声学研究中具有额外潜在用途,其中 11.30% 参与者报告哮喘,27.20% 具有相关联的流感 PCR 检测结果。

关键词

引用

@article{arxiv.2212.07738,
  title  = {A large-scale and PCR-referenced vocal audio dataset for COVID-19},
  author = {Jobie Budd and Kieran Baker and Emma Karoune and Harry Coppock and Selina Patel and Ana Tendero Cañadas and Alexander Titcomb and Richard Payne and David Hurley and Sabrina Egglestone and Lorraine Butler and Jonathon Mellor and George Nicholson and Ivan Kiskin and Vasiliki Koutra and Radka Jersakova and Rachel A. McKendry and Peter Diggle and Sylvia Richardson and Björn W. Schuller and Steven Gilmour and Davide Pigoli and Stephen Roberts and Josef Packham and Tracey Thornley and Chris Holmes},
  journal= {arXiv preprint arXiv:2212.07738},
  year   = {2023}
}

备注

39 pages, 4 figures