医学图像分析研究中的数据集增长
图像与视频处理
2019-08-22 v1 计算机视觉与模式识别
摘要
医学图像分析研究通常需要医学图像数据集用于算法的训练、测试与验证。深度学习革命以及机器学习在近期医学图像分析研究中的主导地位凸显了这一需求。然而,由于伦理与法律约束、商业冲突以及对繁忙医疗专业人员的依赖,医学图像分析研究者被描述为“数据饥渴”。由于缺乏数据集规模充足性的客观标准,研究界通过同行评审过程隐式地设定了临时标准。我们假设,同行评审要求研究者报告使用不断增长的数据集,作为将其工作接受至声誉良好出版场所的条件之一。为验证该假设,我们扫描了 2011 至 2018 年著名的 MICCAI(医学图像计算与计算机辅助介入)会议论文集。在总计 2136 篇文章中,我们聚焦于 907 篇涉及 MRI(磁共振成像)、CT(计算机断层扫描)和 fMRI(功能磁共振成像)人体数据集的论文。对于每种模态,我们在 2011-2018 各年中计算了当年 MICCAI 文章所用人体受试者数量的平均值、几何均值与中位数。结果证实了数据集增长假设。具体而言,MICCAI 文章中的年度中位数据集规模在 2011 至 2018 年间增长了约 3-10 倍,取决于成像模态。统计分析进一步支持数据集增长假设,并揭示几何均值数据集规模呈指数增长,MRI 年增长率约 21%,CT 约 24%,fMRI 约 31%。与摩尔定律略有类似,该结果可就医学图像分析界对数据集规模的预期趋势提供指导。
引用
@article{arxiv.1908.07765,
title = {Dataset Growth in Medical Image Analysis Research},
author = {Yuval Landau and Nahum Kiryati},
journal= {arXiv preprint arXiv:1908.07765},
year = {2019}
}