利用开放数据开发胸片COVID-19检测深度学习方案的隐患
计算机视觉与模式识别
2021-09-17 v1 机器学习
图像与视频处理
摘要
自 COVID-19 出现以来,已有诸多深度学习模型被开发用于从胸部 X 光片中识别 COVID-19。由于几乎无法直接获取医院数据,AI 界严重依赖包含多个数据源的公共数据。在开源数据上训练与测试时,模型性能表现异常优异,超越了 COVID-19 暴发前所报道的 AI 肺炎检测能力。本研究在广泛使用的开源数据上训练具有影响力的模型,并在外部测试集与医院数据集上测试,任务是将胸片分为三类:COVID-19、非 COVID 肺炎与无肺炎。通过 ROC 曲线、混淆矩阵及标准分类指标评估所研究模型的分类性能。我们实现了可解释性模块以探索对分类最重要的图像特征。数据分析与模型评估表明,流行的开源数据集 COVIDx 并不能代表真实临床问题,在其上测试的结果存在虚高。对开源数据的依赖会使模型易受偏差与混杂变量影响,需仔细分析以开发临床有用且可行的胸片 COVID-19 检测 AI 工具。
引用
@article{arxiv.2109.08020,
title = {The pitfalls of using open data to develop deep learning solutions for COVID-19 detection in chest X-rays},
author = {Rachael Harkness and Geoff Hall and Alejandro F Frangi and Nishant Ravikumar and Kieran Zucker},
journal= {arXiv preprint arXiv:2109.08020},
year = {2021}
}
备注
To be published in MedInfo 21 - 18th World Congress on Medical and Health Informatics; 5 pages, 5 figures