中文

Decipher-MR:面向 3D MRI 表示的视觉语言基础模型

计算机视觉与模式识别 2026-02-04 v2 人工智能 机器学习

摘要

磁共振成像是临床诊断和研究中关键的成像模态,然而其复杂性和异质性阻碍了可扩展且通用的机器学习。尽管基础模型在语言和视觉任务中取得了革命性进展,但其在 MRI 上的应用仍受数据稀缺和解剖学聚焦范围限制。我们提出了 Decipher-MR,这是一个针对 3D MRI 的视觉语言基础模型,基于来自 20 万个 MRI 系列(覆盖 2.2 万多个研究)的训练,涵盖多样的解剖区域、序列和病理。Decipher-MR 将自监督视觉学习与报告引导的文本监督相结合,以构建面向广泛应用的稳健表征。为提高使用效率,Decipher-MR 支持模块化设计,使能够附加轻量级、任务特定的解码器并对预训练编码器进行微调。遵循此设置,我们在疾病分类、人口学特征预测、解剖定位和跨模态检索等任务上评估了 Decipher-MR,结果显示相较于现有基础模型和任务特定方法,Decipher-MR 在所有任务上都实现了持续的性能提升。这些结果将 Decipher-MR 定位为 MRI 基于 AI 的临床和研究应用的多功能基础模型。

关键词

引用

@article{arxiv.2509.21249,
  title  = {Decipher-MR: A Vision-Language Foundation Model for 3D MRI Representations},
  author = {Zhijian Yang and Noel DSouza and Istvan Megyeri and Xiaojian Xu and Amin Honarmandi Shandiz and Farzin Haddadpour and Krisztian Koos and Laszlo Rusko and Emanuele Valeriano and Bharadwaj Swaninathan and Lei Wu and Parminder Bhatia and Taha Kass-Hout and Erhan Bas},
  journal= {arXiv preprint arXiv:2509.21249},
  year   = {2026}
}