中文

探索大规模公共医学图像数据集

图像与视频处理 2019-07-31 v1 计算机视觉与模式识别 机器学习

摘要

目的与背景:医学人工智能系统依赖于特征明确的大规模数据集。近期发布的公共数据集引起了该领域的极大兴趣,但由于其造成了数据生成与数据使用之间的脱节,带来了特定挑战,可能限制这些数据集的效用。材料与方法:我们对两个大型公共数据集进行可视化探索,以确定所提供的标签准确程度以及是否存在其他潜在问题。ChestXray14 数据集包含 112,120 张胸部正位 X 线胶片,MURA 数据集包含 40,561 张上肢放射影像。由一名获委员会认证的放射科医生审阅两个数据集中约 700 张图像的子集,并确定原始标签的质量。结果:ChestXray14 的标签未能准确反映图像的视觉内容,其阳性预测值大多比原始文档中给出的值低 10% 至 30%。还存在其他显著问题,例如隐藏分层和标签消歧失败。MURA 的标签较为准确,但对于患有退行性关节疾病的病例子集,原始正常/异常标签不准确,其灵敏度为 60%,特异度为 82%。结论:图像的可视化检查是理解大型图像数据集的必要组成部分。我们建议制作公共数据集的团队应执行这一重要的质量控制程序,并在其数据集文档中包括对发现的详尽描述,以及数据生成过程和标注规则的说明。

关键词

引用

@article{arxiv.1907.12720,
  title  = {Exploring large scale public medical image datasets},
  author = {Luke Oakden-Rayner},
  journal= {arXiv preprint arXiv:1907.12720},
  year   = {2019}
}

备注

9 pages, 5 tables