中文

训练医学图像深度学习系统以达到所需高准确率需要多少数据?

机器学习 2016-01-11 v2 计算机视觉与模式识别 神经与进化计算

摘要

卷积神经网络(CNN)在自然图像分类系统中的应用产生了非常令人瞩目的成果。结合医学图像使其非常适合深度学习的固有特性,将此类系统进一步应用于医学图像分类具有广阔前景。然而,如果此类系统未能达到目标准确率,其实用性和潜在影响可能会被完全抵消。本文针对确定在医学图像分类系统中实现高分类准确率和低方差所需的最佳训练数据集大小进行了研究。我们将 CNN 应用于将轴向计算机断层扫描(CT)图像分类为六个解剖类别。我们使用六种不同大小的训练数据集(5、10、20、50、100 和 200)训练 CNN,随后使用总计 6000 张 CT 图像对生成的系统进行测试。所有图像均采集自麻省总医院(MGH)的图像归档与通信系统(PACS)。利用这些数据,我们采用学习曲线方法来预测给定训练样本量下的分类准确率。我们的研究将提出一种通用方法,用于确定达到特定目标分类准确率所需的训练数据集大小,该方法可轻松应用于此类系统中的其他问题。

关键词

引用

@article{arxiv.1511.06348,
  title  = {How much data is needed to train a medical image deep learning system to achieve necessary high accuracy?},
  author = {Junghwan Cho and Kyewook Lee and Ellie Shin and Garry Choy and Synho Do},
  journal= {arXiv preprint arXiv:1511.06348},
  year   = {2016}
}