中文

Triad:面向 3D 磁共振成像的视觉基础模型

计算机视觉与模式识别 2025-02-25 v2 人工智能

摘要

视觉基础模型(VFM)通常在大规模图像数据集上进行预训练,以学习通用表征用于多种数据类型。这些模型随后可微调以适用于特定下游任务,显著提升广泛应用场景下的性能。然而,现有声称适用于各种临床任务的视觉基础模型大多预训练于 3D CT 数据集上,这得益于大规模 3D CT 数据库的可用性。CT 与磁共振成像(MRI)在成像原理、信号特性和数据分布方面存在显著差异,可能阻碍其在 MRI 特定应用中的实际性能和灵活性。本文提出Triad,一种面向 3D MRI 的视觉基础模型。Triad 采用广泛使用的自编码器结构,从 131,170 份 3D MRI 体数据中学习稳健表征,并利用器官无关的成像描述约束视觉模态的语义分布。上述预训练数据集称为 Triad-131K,目前是最大规模的 3D MRI 预训练数据集。我们在三个任务上评估了Triad,即器官/肿瘤分割、器官/癌症分类和医学图像配准,分别在两种数据模态(域内和域外)设置下,使用 25 个下游数据集。通过使用Triad的预训练权重初始化模型,nnUNet-Triad 在 17 个数据集上分割性能提升 2.51%;Swin-B-Triad 在五个数据集上的分类任务提升 3.97%;SwinUNETR-Triad 在两个数据集上的配准任务提升 4.00%。我们的研究表明,在上游和下游任务的数据模态和器官一致时,预训练可显著提升性能。

关键词

引用

@article{arxiv.2502.14064,
  title  = {Triad: Vision Foundation Model for 3D Magnetic Resonance Imaging},
  author = {Shansong Wang and Mojtaba Safari and Qiang Li and Chih-Wei Chang and Richard LJ Qiu and Justin Roper and David S. Yu and Xiaofeng Yang},
  journal= {arXiv preprint arXiv:2502.14064},
  year   = {2025}
}