中文

“说出制造商之名”:训练深度学习模型时图像采集偏置与任务复杂度的关联——基于头部CT的实验

图像与视频处理 2020-08-20 v1 计算机视觉与模式识别 机器学习

摘要

随着将机器学习技术应用于医学图像的兴趣持续快速增长,模型正开始被开发与部署用于临床应用。在临床AI模型开发生命周期(由Lu等人[1]描述)中,对于机器学习科学家和临床医生而言,正确设计与收集数据队列是一个关键阶段。在此步骤中,识别数据集中各种形式的偏置与分布偏移的能力至关重要。尽管仍难以考虑所有潜在的偏置来源,但可以开发技术来识别特定类型的偏置,以减轻其影响。在本工作中,我们分析了数据集中扫描仪制造商的分布如何导致深度学习模型的整体偏置。我们针对分类与分割任务评估卷积神经网络(CNN),具体采用两个最先进的模型:用于分类的ResNet[2]与用于分割的U-Net[3]。我们证明CNN能够学会区分成像扫描仪制造商,并且这种偏置会显著影响分类与分割任务的模型性能。通过创建一个模拟或多或少细微病灶存在的脑数据原始合成数据集,我们还表明这种偏置与任务难度相关。识别此类偏置对于开发鲁棒、可泛化的模型至关重要,这些模型对于真实世界数据分布中的临床应用将是关键所在。

关键词

引用

@article{arxiv.2008.08525,
  title  = {"Name that manufacturer". Relating image acquisition bias with task complexity when training deep learning models: experiments on head CT},
  author = {Giorgio Pietro Biondetti and Romane Gauriau and Christopher P. Bridge and Charles Lu and Katherine P. Andriole},
  journal= {arXiv preprint arXiv:2008.08525},
  year   = {2020}
}

备注

15 pages, 4 figures. This paper has been submitted to the Journal of Digital Imaging (Springer Journal) and it is now in review