中文

AI 在图块上打滑:数字病理学中的数据泄漏

定量方法 2020-11-18 v3 图像与视频处理

摘要

AI 模型在生物医学数据上的可重复性仍是其被临床实践接受的一大关切。诸如 MAQC 联盟等用于预测性生物标志物开发可重复性的倡议,已强调适当的数据分析计划(DAPs)对于控制包括从训练集到测试集的数据泄漏在内的各类偏倚的重要性。在数字病理学背景下,泄漏通常潜藏于弱设计的实验中,这些实验在数据划分方案中没有考虑受试者。当考虑切片的部分或子区域(即“图块”)时,该问题进一步加剧。尽管学界已广泛认识到这一方面,我们认为它常被忽视。在本研究中,我们评估了数据泄漏对基于多个组织学数据集合训练与验证的机器学习模型性能的影响。我们证明,即便采用适当设计的 DAP(10×5 重复交叉验证),当同一受试者的图块同时出现在训练集与验证集中时,深度学习模型的预测分数可被虚高至多 41%。我们在 3 个组织病理学数据集上针对 44 个分类任务复现了实验,共计 374 名受试者、556 张切片及超过 27,000 个图块。此外,我们讨论了数据泄漏对使用在通用数据集或离任务数字病理学集合上预训练的模型的迁移学习策略的影响。最后,我们提出了一种基于 histolab(一个用于组织学数据预处理的新型 Python 包)的自动化构建数字病理学无泄漏深度学习流程的解决方案。我们在两个公共数据集(TCGA 和 GTEx)上验证了该方案。

关键词

引用

@article{arxiv.1909.06539,
  title  = {AI slipping on tiles: data leakage in digital pathology},
  author = {Nicole Bussola and Alessia Marcolini and Valerio Maggio and Giuseppe Jurman and Cesare Furlanello},
  journal= {arXiv preprint arXiv:1909.06539},
  year   = {2020}
}