从竞争到协作:利用联邦学习使 Kaggle 上的玩具数据集对胸部 X 光诊断具有临床效用
图像与视频处理
2022-11-14 v1 计算机视觉与模式识别
机器学习
摘要
托管于 Kaggle 的胸部 X 光(CXR)数据集,尽管从数据科学竞赛角度看颇有价值,但由于其仅聚焦于诊断某一种特定疾病,在临床应用中的效用有限。在真实世界的临床使用中,由于多种疾病可能在同一患者身上共存,需同时考虑多种疾病。本工作中,我们展示了如何利用联邦学习(FL)使这些来自 Kaggle 的玩具 CXR 数据集具备临床效用。具体而言,我们使用两个独立的 CXR 数据集——一个标注了肺炎存在与否,另一个标注了气胸存在与否(两种常见且危及生命的病症)——训练一个单一的 FL 分类模型(`global`),使其能够诊断这两种疾病。我们在两种不同模型架构下,将该全局 FL 模型与分别在两个数据集上单独训练的模型(`baseline`)的性能进行比较。在一个标准的、朴素的 3 层 CNN 架构上,全局 FL 模型对肺炎与气胸的 AUROC 分别为 0.84 和 0.81,而两个 baseline 模型分别为 0.85 和 0.82(p>0.05)。类似地,在一个预训练的 DenseNet121 架构上,全局 FL 模型对肺炎与气胸的 AUROC 分别为 0.88 和 0.91,而两个 baseline 模型分别为 0.89 和 0.91(p>0.05)。我们的结果表明,FL 可用于创建全局 `meta` 模型,使 Kaggle 上的玩具数据集具备临床效用,这是朝缩小从实验室到临床(bench to bedside)差距迈出的一步。
引用
@article{arxiv.2211.06212,
title = {From Competition to Collaboration: Making Toy Datasets on Kaggle Clinically Useful for Chest X-Ray Diagnosis Using Federated Learning},
author = {Pranav Kulkarni and Adway Kanhere and Paul H. Yi and Vishwa S. Parekh},
journal= {arXiv preprint arXiv:2211.06212},
year = {2022}
}
备注
Accepted paper for Medical Imaging meet NeurIPS (MedNeurIPS) Workshop 2022