中文

用于3D计算机断层扫描的多模态数据集通用基础模型

计算机视觉与模式识别 2026-02-10 v5

摘要

医学成像AI,特别是3D成像方面的进展受限于数据集的稀缺。我们引入CT-RATE,一个公开数据集,将3D医学图像与相应的文本报告配对。CT-RATE包含来自21,304名唯一患者的25,692个非对比3D胸部CT扫描。每个扫描都伴随其相应的放射学报告。利用CT-RATE,我们开发了CT-CLIP,一个针对广泛应用的CT侧重对比语言-图像预训练框架,无需特定任务的训练。我们展示了CT-CLIP在多异常检测和案例检索中的用法, 在所有关键指标上均优于最先进的全监督模型。通过将CT-CLIP的视觉编码器与预训练的大型语言模型结合,我们创建了CT-CHAT,一个针对3D胸部CT体积的视觉-语言基础聊天模型。在来自CT-RATE数据集派生的270万多对问答对上微调后,CT-CHAT凸显了3D医学成像中专用方法的必要性。总体而言,CT-RATE、CT-CLIP和CT-CHAT的开源发布不仅解决了3D医学成像中的关键挑战,也为医学AI和改善患者护理的未来创新奠定了基础。

关键词

引用

@article{arxiv.2403.17834,
  title  = {Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography},
  author = {Ibrahim Ethem Hamamci and Sezgin Er and Chenyu Wang and Furkan Almas and Ayse Gulnihan Simsek and Sevval Nil Esirgun and Irem Dogan and Omer Faruk Durugol and Benjamin Hou and Suprosanna Shit and Weicheng Dai and Murong Xu and Hadrien Reynaud and Muhammed Furkan Dasdelen and Bastian Wittmann and Tamaz Amiranashvili and Enis Simsar and Mehmet Simsar and Emine Bensu Erdemir and Abdullah Alanbay and Anjany Sekuboyina and Berkan Lafci and Ahmet Kaplan and Zhiyong Lu and Malgorzata Polacin and Bernhard Kainz and Christian Bluethgen and Kayhan Batmanghelich and Mehmet Kemal Ozdemir and Bjoern Menze},
  journal= {arXiv preprint arXiv:2403.17834},
  year   = {2026}
}