中文

VolTA-3D:基于 3D 体积标记对脑 MRI 的自监督学习

计算机视觉与模式识别 2026-05-19 v1 人工智能 机器学习

摘要

自监督学习 (SSL) 通过利用大规模无标签数据推进了医学图像分析,但在脑磁共振成像 (MRI) 中,大多数 3D 模型要么专用于分割,要么专用于分类,限制了其在跨数据集、成像协议和下游任务上的泛化能力。这种缺乏可迁移性限制了 3D MRI 模型的临床实用性,尽管存在大量无标签体积数据。我们提出 Volta-3D,一个面向学习可迁移体积表示的 3D Vision Transformer 框架。Volta-3D 在学生-教师范式下联合对齐全局类别样式标记和局部 patch 标记,并强制进行细粒度结构重建。这种全局-局部对齐解决了脑 MRI 受限的语义多样性和微妙解剖特征的挑战,这些挑战限制了现有 SSL 方法的效果。我们在多个跨域下游任务上评估了 Volta-3D,包括小脑旁核分割和健康对照组与阿尔茨海默病患者的性别分类。在所有任务中,Volta-3D 学习到的表示均优于随机初始化的基线,显示出在域迁移下的 improved transferability 和 robustess。因此,在预训练期间联合强制全局语义一致性和局部结构学习,使我们能够从无标签脑 MRI 数据中获得更广泛的概念学习。总体而言,VolTA-3D 支持任务特定 fine-tuning 下的有效多任务下游性能,是通用且临床可行 3D 模型的一步步进。

关键词

引用

@article{arxiv.2605.16775,
  title  = {VolTA-3D: Self-Supervised Learning for Brain MRI using 3D Volumetric Token Alignment},
  author = {Amy Makawana and Abhijeet Parida and Marius George Linguraru and Julia Ive and Syed Muhammad Anwar},
  journal= {arXiv preprint arXiv:2605.16775},
  year   = {2026}
}

备注

Accepted at EMBC 2026