视频预训练推进胸部 CT 任务上的 3D 深度学习
图像与视频处理
2023-04-04 v1 计算机视觉与模式识别
机器学习
摘要
在 ImageNet 等大型自然图像分类数据集上的预训练,已助力了数据稀缺的 2D 医疗任务上的模型开发。3D 医疗任务的数据通常远少于 2D 医疗任务,促使从业者依赖预训练的 2D 模型来提取切片特征。然而,由于这些 2D 模型本身未利用截面或时间信息,在 3D 计算机视觉基准上已被 3D 模型超越。本研究中,我们探究 3D 模型的天然视频预训练能否在较小数据集上实现更优的 3D 医疗任务性能。我们证明,视频预训练提升了七个 3D 模型在两个胸部 CT 数据集上的平均性能,且与微调数据集大小无关,且视频预训练使 3D 模型优于 2D 基线。最后,我们观察到在大规模域外 Kinetics 数据集上预训练比在典型规模的域内 CT 数据集上预训练提升更多。我们的结果显示了视频预训练在广泛架构、任务和训练数据集大小上的一致收益,支持 3D 医疗任务从小规模域内预训练转向大规模域外预训练。我们的代码见:https://github.com/rajpurkarlab/chest-ct-pretraining
引用
@article{arxiv.2304.00546,
title = {Video Pretraining Advances 3D Deep Learning on Chest CT Tasks},
author = {Alexander Ke and Shih-Cheng Huang and Chloe P O'Connell and Michal Klimont and Serena Yeung and Pranav Rajpurkar},
journal= {arXiv preprint arXiv:2304.00546},
year = {2023}
}
备注
Accepted at MIDL 2023