用于病理分类与定位的太字节级深度多示例学习
计算机视觉与模式识别
2018-10-01 v2
摘要
在计算病理学领域,由最先进深度学习方案驱动的决策支持系统的使用一直受到缺乏大型标注数据集的阻碍。直到最近,研究依赖的数据集规模仅为数百张切片,不足以训练可在临床大规模应用的模型。在此,我们收集了一个包含 12,160 张切片的数据集,比先前病理学数据集大两个数量级,相当于整个 ImageNet 数据集像素数的 25 倍。鉴于我们的数据集规模,我们可以在多示例学习(MIL)假设下训练深度学习模型,其中仅需整体切片诊断即可训练,避免了通常属于监督学习方法的所有昂贵像素级标注。我们在一个复杂任务上测试了我们的框架,即针吸活检中的前列腺癌诊断。我们在多种条件下对 MIL 流程性能进行了全面评估,在 1,824 张切片的留出测试集上取得了 0.98 的 AUC。这些结果开辟了大规模训练准确诊断预测模型之路,为临床决策支持系统部署奠定基础。
引用
@article{arxiv.1805.06983,
title = {Terabyte-scale Deep Multiple Instance Learning for Classification and Localization in Pathology},
author = {Gabriele Campanella and Vitor Werneck Krauss Silva and Thomas J. Fuchs},
journal= {arXiv preprint arXiv:1805.06983},
year = {2018}
}