中文

构建用于卒中深度学习软件开发的医学图像数据集的挑战

图像与视频处理 2023-09-27 v1

摘要

尽管临床实践中产生了大量的脑部CT数据,但目前用于深度学习(DL)研究的CT数据集可用性有限。此外,数据可能未充分或不恰当地为机器学习做准备,从而导致虚假且不可复现的分析。这种对全面且多样化数据集的缺乏,对DL算法的开发构成了重大挑战。在这项工作中,我们提出了一个完整的半自动流程,以应对为DL分析准备临床脑部CT数据集的挑战,并描述了标准化这一异构数据集的过程。挑战包括处理具有不同方位(轴位、矢状位、冠状位)、不同图像类型(用于观察软组织或骨骼)和不同维度的图像集,以及去除冗余背景。最终流程能够处理5,868/10,659(45%)的CT图像数据集。被拒绝的原因包括非轴位数据(n=1,920)、骨重建图像(n=687)、分离的头颅基底部/穹隆部图像(n=1,226)以及配准失败(n=465)。进一步的格式调整,包括图像裁剪、缩放和尺寸调整,也是DL处理所需要的。在非定位像、非骨重建且非分裂脑的轴位扫描中,5,868/6,333(93%)被接受,其余465例配准过程失败。为DL适当准备医学成像数据集是一个成本高且耗时的过程。

关键词

引用

@article{arxiv.2309.15081,
  title  = {Challenges of building medical image datasets for development of deep learning software in stroke},
  author = {Alessandro Fontanella and Wenwen Li and Grant Mair and Antreas Antoniou and Eleanor Platt and Chloe Martin and Paul Armitage and Emanuele Trucco and Joanna Wardlaw and Amos Storkey},
  journal= {arXiv preprint arXiv:2309.15081},
  year   = {2023}
}

备注

9 pages, 5 figures