用于十亿像素全切片图像计算病理学的联邦学习
图像与视频处理
2020-09-24 v2 计算机视觉与模式识别
机器学习
组织与器官
摘要
基于深度学习的计算病理学算法已展现出在广泛任务上的卓越能力,从表征已知的形态学表型,到从组织学预测如分子改变等非人类可识别特征。然而,鲁棒、可适应且准确的基于深度学习的模型的开发,往往依赖于收集并耗时筛选大量高质量标注训练数据,这些数据理想情况下应来自多样来源与患者群体,以应对此类数据集中存在的异质性。多中心且协作性的跨机构医学数据整合自然有助于克服这一挑战并提升模型性能,但受限于隐私问题以及随着模型扩展至使用数十万张十亿像素全切片图像时复杂数据共享过程中可能出现的其他困难。本文引入用于计算病理学中十亿像素全切片图像的隐私保护联邦学习,采用弱监督注意力多示例学习与差分隐私。我们在两个不同诊断问题上使用数千张仅含切片级标签的组织学全切片图像评估了我们的方法。此外,我们提出一个用于从全切片图像进行生存预测与患者分层的弱监督学习框架,并展示了其在联邦设定下的有效性。我们的结果表明,利用联邦学习,我们可在不直接共享数据及其相关复杂性的情况下,从分布式数据孤岛有效开发准确的弱监督深度学习模型,同时借助随机噪声生成保留差分隐私。
引用
@article{arxiv.2009.10190,
title = {Federated Learning for Computational Pathology on Gigapixel Whole Slide Images},
author = {Ming Y. Lu and Dehan Kong and Jana Lipkova and Richard J. Chen and Rajendra Singh and Drew F. K. Williamson and Tiffany Y. Chen and Faisal Mahmood},
journal= {arXiv preprint arXiv:2009.10190},
year = {2020}
}