基于机器学习的大规模胸部CT容积多异常预测
图像与视频处理
2020-10-14 v3 计算机视觉与模式识别
机器学习
摘要
用于放射学的机器学习模型受益于带有高质量异常标签的大规模数据集。我们整理并分析了一个来自19,993名唯一患者的36,316个容积的胸部计算机断层扫描(CT)数据集。这是已报道的最大规模多标注容积医学影像数据集。为标注该数据集,我们开发了一种基于规则的方法,用于从自由文本放射学报告中自动提取异常标签,其平均F值为0.976(最小0.941,最大1.0)。我们还开发了一个用于胸部CT容积多器官、多疾病分类的模型,该模型使用深度卷积神经网络(CNN)。该模型在18种异常上达到了大于0.90的AUROC分类性能,在所有83种异常上的平均AUROC为0.773,证明了从未经滤除的整个容积CT数据中学习的可行性。我们表明,在更多标签上训练可显著提升性能:对于9种标签的子集——结节、 opacity、肺不张、胸腔积液、实变、肿块、心包积液、心肥大和气胸——当训练标签数量从9增加到全部83时,模型的平均AUROC提高了10%。容积预处理、自动标签提取和容积异常预测模型的所有代码将公开可用。这36,316个CT容积及标签在获得机构批准后也将公开可用。
引用
@article{arxiv.2002.04752,
title = {Machine-Learning-Based Multiple Abnormality Prediction with Large-Scale Chest Computed Tomography Volumes},
author = {Rachel Lea Draelos and David Dov and Maciej A. Mazurowski and Joseph Y. Lo and Ricardo Henao and Geoffrey D. Rubin and Lawrence Carin},
journal= {arXiv preprint arXiv:2002.04752},
year = {2020}
}
备注
20 pages, 3 figures, 5 tables (appendices additional). Published in Medical Image Analysis (October 2020)