中文

公开可用 COVID-19 X 射线影像数据集的构成与局限

图像与视频处理 2020-08-27 v1 计算机视觉与模式识别 机器学习

摘要

基于机器学习的从影像数据诊断与预测 COVID-19 进展的方法在近几个月获得了显著关注,尤其是深度学习模型的使用。在此背景下提出了数百种模型,其中大多数在公开数据集上训练。数据稀缺、训练与目标人群不匹配、组别不平衡以及缺乏文档是重要的偏倚来源,阻碍了这些模型在真实临床实践中的适用性。考虑到数据集是模型构建与评估的基本组成部分,亟需对当前现状的深入理解。本文综述当前公开的 COVID-19 胸部 X 射线数据集。对每个数据集作简要描述,并指明其潜在优势、局限及数据集间的关联。特别地,指出了当前数据集中可能成为偏倚来源、损害在其上训练模型的一些关键属性。这些描述有助于在这些数据集上构建模型、根据模型目标选择最佳数据集、考量特定局限以避免报告过度自信的基准结果,并讨论其在特定临床环境中的泛化能力影响。

关键词

引用

@article{arxiv.2008.11572,
  title  = {On the Composition and Limitations of Publicly Available COVID-19 X-Ray Imaging Datasets},
  author = {Beatriz Garcia Santa Cruz and Jan Sölter and Matias Nicolas Bossa and Andreas Dominik Husch},
  journal= {arXiv preprint arXiv:2008.11572},
  year   = {2020}
}

备注

12 pages, 3 figures