中文

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

计算机视觉与模式识别 2026-03-05 v2 人工智能

摘要

腹部 CT 扫描数据量大且放射科医生短缺,加剧了自动化医学图像分析工具的需求。以往的领先方法用于自动分析利用视觉语言模型(VLM)联合建模图像和放射科报告。然而,当前医学 VLM 通常仅限于 2D 图像和短报告。为克服这些局限性进行腹部 CT 解读,本文我们引入 Merlin,一个 3D VLM,从体积 CT 扫描、电子健康记录数据和放射科报告中进行学习。这种方法由多阶段预训练框架实现,无需额外手动标注。我们使用高质量临床数据集训练 Merlin,包括配对 CT 扫描(超过 600 万图像,来自 15,331 项 CT 扫描)、诊断代码(超过 180 万个代码)和放射科报告(超过 600 万个标记)。我们全面评估了 Merlin 在 6 种任务类型和 752 个单独任务上的表现,这些任务覆盖诊断、预后和质量相关任务。非适应(即开箱即用)任务包括发现(30 项)的零样本分类、表型分类(692 种表型)以及图像到发现和图像到 impression 的零样本跨模态检索。模型适应任务包括 5 年慢性病预测(6 种疾病)、放射科报告生成和 3D 语义分割(20 种器官)。我们大规模验证了 Merlin,内部测试使用 5,137 项 CT 扫描,外部测试使用来自 3 个独立机构和 2 个公共数据集的 44,098 项 CT 扫描。结果显示其在不同机构和解剖部位上的高泛化能力。Merlin 在 2D VLM、CT 基础模型和即插即用放射科模型方面表现优异。我们也发布了训练好的模型、代码和数据集,地址为:https://github.com/StanfordMIMI/Merlin。

关键词

引用

@article{arxiv.2406.06512,
  title  = {Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset},
  author = {Louis Blankemeier and Ashwin Kumar and Joseph Paul Cohen and Jiaming Liu and Longchao Liu and Dave Van Veen and Syed Jamal Safdar Gardezi and Hongkun Yu and Magdalini Paschali and Zhihong Chen and Jean-Benoit Delbrouck and Eduardo Reis and Robbie Holland and Cesar Truyts and Christian Bluethgen and Yufu Wu and Long Lian and Malte Engmann Kjeldskov Jensen and Sophie Ostmeier and Maya Varma and Jeya Maria Jose Valanarasu and Zhongnan Fang and Zepeng Huo and Zaid Nabulsi and Diego Ardila and Wei-Hung Weng and Edson Amaro Junior and Neera Ahuja and Jason Fries and Nigam H. Shah and Greg Zaharchuk and Marc Willis and Adam Yala and Andrew Johnston and Robert D. Boutin and Andrew Wentland and Curtis P. Langlotz and Jason Hom and Sergios Gatidis and Akshay S. Chaudhari},
  journal= {arXiv preprint arXiv:2406.06512},
  year   = {2026}
}

备注

Nature (2026)