数据划分对泛化能力的影响:基于咳嗽与上下文识别 COVID-19
声音
2021-06-09 v1 机器学习
音频与语音处理
摘要
快速扩大筛查、检测和隔离已被证明是应对 COVID-19 大流行的有效策略。我们考虑应用深度学习技术,利用可通过手机获取的数据来区分 COVID 与非 COVID 个体。使用咳嗽和上下文(症状和元数据)代表了一种有前景的方法。该方向上的若干独立工作已显示出有希望的结果。然而,它们均未报告在临床相关数据划分下的性能,具体而言,即在时间上划分开发集与测试集(回顾性验证)以及跨中心划分(广泛验证)时的性能。尽管在这些划分下存在有意义的泛化,但性能差异显著(高达 0.1 的 AUC 分数)。此外,我们研究了有症状和无症状个体在这三种划分下的性能。最后,我们表明我们的模型关注输入中有意义的特征:咳嗽段对应咳嗽,相关症状对应上下文。代码与检查点可在 https://github.com/WadhwaniAI/cough-against-covid 获取。
引用
@article{arxiv.2106.03851,
title = {Impact of data-splits on generalization: Identifying COVID-19 from cough and context},
author = {Makkunda Sharma and Nikhil Shenoy and Jigar Doshi and Piyush Bagad and Aman Dalmia and Parag Bhamare and Amrita Mahale and Saurabh Rane and Neeraj Agrawal and Rahul Panicker},
journal= {arXiv preprint arXiv:2106.03851},
year = {2021}
}
备注
Published as a workshop paper at ICLR 2021 AI for Public Health Workshop and ICLR 20201 Machine Learning for Preventing and Combating Pandemics Workshop