面向神经影像分析的 3D 视觉架构的视频与合成 MRI 预训练
图像与视频处理
2023-09-12 v1 人工智能
计算机视觉与模式识别
摘要
迁移学习代表了我们构建人工智能(AI)系统的近期范式转变。与训练特定任务的模型不同,迁移学习涉及在大型数据语料库上预训练深度学习模型,并对其进行最小程度的微调以适应特定任务。即便如此,对于 3D 医学影像任务,我们并不知道最佳做法是在自然图像、医学图像,甚至是合成生成的 MRI 扫描或视频数据上预训练模型。为评估这些替代方案,我们在此基准测试了采用不同上游预训练方法初始化的视觉Transformer(ViT)和卷积神经网络(CNN)。随后将这些方法适配到三个难度各异的下游神经影像任务:阿尔茨海默病(AD)和帕金森病(PD)分类、“脑年龄”预测。实验测试得出以下关键观察:1. 预训练提升了所有任务的性能,其中 ViT 的 AD 分类提升 7.4%、PD 分类提升 4.6%,CNN 的 PD 分类提升 19.1%且脑年龄预测误差减少 1.26 年;2. 在大规模视频或合成 MRI 数据上预训练提升了 ViT 的性能;3. CNN 在有限数据场景下具有鲁棒性,且域内预训练增强了其性能;4. 预训练提升了对分布外数据集与站点的泛化能力。总体而言,我们基准测试了不同的视觉架构,揭示了利用新兴数据集预训练它们以进行模型初始化的价值。所得预训练模型可适配一系列下游神经影像任务,即便目标任务的训练数据有限。
引用
@article{arxiv.2309.04651,
title = {Video and Synthetic MRI Pre-training of 3D Vision Architectures for Neuroimage Analysis},
author = {Nikhil J. Dhinagar and Amit Singh and Saket Ozarkar and Ketaki Buwa and Sophia I. Thomopoulos and Conor Owens-Walton and Emily Laltoo and Yao-Liang Chen and Philip Cook and Corey McMillan and Chih-Chien Tsai and J-J Wang and Yih-Ru Wu and Paul M. Thompson},
journal= {arXiv preprint arXiv:2309.04651},
year = {2023}
}