拥抱巨大的医疗数据
图像与视频处理
2024-07-08 v1 计算机视觉与模式识别
摘要
随着扫描数量、类别数目和数据来源的不断增加,大量医疗数据逐渐可用,现有的训练范式——即以多次遍历固定、有限数据集进行 AI 训练——面临重大挑战。首先,一次性对如此巨大的数据进行训练是不可行的,因为新的扫描、数据来源和类别不断到达。其次,持续训练新的扫描、数据来源和类别可能导致灾难性遗忘,即 AI 在学习新数据时会忘记旧数据,反之亦然。为解决这两个挑战,我们提出一种在线学习方法,使 AI 能够从大规模医疗数据中进行训练。与反复在随机选取的数据样本上训练不同,我们的方法基于数据唯一性和预测不确定性识别当前 AI 模型最重要的样本,然后对这些有选择的样本进行训练。与现有训练范式相比,我们的方法不仅通过在持续的数据流上进行训练提高了数据效率,还通过对可能被遗忘的重要数据样本进行选择性训练来缓解灾难性遗忘,在多器官和肿瘤分割任务中性能提升约 15%。代码已公开于 https://github.com/MrGiovanni/OnlineLearning。
引用
@article{arxiv.2407.04687,
title = {Embracing Massive Medical Data},
author = {Yu-Cheng Chou and Zongwei Zhou and Alan Yuille},
journal= {arXiv preprint arXiv:2407.04687},
year = {2024}
}
备注
Accepted to MICCAI 2024