中文

在结构 MRI 扫描上高效训练视觉 Transformer 用于阿尔茨海默病检测

图像与视频处理 2023-03-16 v1 人工智能 计算机视觉与模式识别 机器学习 定量方法

摘要

大规模人群神经影像对于识别促进或抵抗脑部疾病的因素以及辅助诊断、分型和预后具有重要价值。卷积神经网络(CNNs)等数据驱动模型已越来越多地应用于脑图像,通过学习鲁棒特征来执行诊断和预后任务。视觉 Transformer(ViT)——一类新的深度学习架构——近年来作为 CNNs 的替代方案出现在若干计算机视觉应用中。在此,我们基于难度测试了 ViT 架构的变体在一系列所需的神经影像下游任务上的表现,本例中为基于 3D 脑 MRI 的性别与阿尔茨海默病(AD)分类。在我们的实验中,两种视觉 Transformer 架构变体分别取得了性别分类 AUC 0.987 和 AD 分类 AUC 0.892。我们在两个基准 AD 数据集的数据上独立评估了我们的模型。通过在合成(由隐扩散模型生成)和真实 MRI 扫描上预训练的视觉 Transformer 模型进行微调,我们分别实现了 5% 和 9-10% 的性能提升。我们的主要贡献包括测试了不同的 ViT 训练策略的影响,包括预训练、数据增强以及学习率预热后退火,这些均针对神经影像领域。这些技术对于在训练数据通常有限的神经影像应用中训练类 ViT 模型至关重要。我们还通过数据-模型缩放曲线分析了所用训练数据量对 ViT 测试时性能的影响。

关键词

引用

@article{arxiv.2303.08216,
  title  = {Efficiently Training Vision Transformers on Structural MRI Scans for Alzheimer's Disease Detection},
  author = {Nikhil J. Dhinagar and Sophia I. Thomopoulos and Emily Laltoo and Paul M. Thompson},
  journal= {arXiv preprint arXiv:2303.08216},
  year   = {2023}
}