中文

Cardiac-CLIP:用于3D心脏CT图像的视觉-语言基础模型

图像与视频处理 2025-07-30 v1 计算机视觉与模式识别

摘要

基础模型在医学领域展现出巨大的潜力,但其在复杂心血管诊断中的应用仍有不足。本文提出Cardiac-CLIP,一种用于3D心脏CT图像的多模态基础模型。Cardiac-CLIP通过两个阶段的预训练实现。第一个阶段采用3D掩码自编码器(MAE)对大规模无标签体数据进行自监督表征学习,使视觉编码器能够捕获丰富的解剖和上下文特征。在第二个阶段,引入对比学习以对齐视觉和文本表征,实现跨模态理解。为支持预训练,我们收集了16641例真实临床CT扫描, supplemented by 114k公开数据。同时,我们将自由文本放射科报告标准化为统一模板,并根据诊断属性构建病理向量,据此生成软标签矩阵以监督对比学习过程。在此基础上,为全面评估Cardiac-CLIP的效果,我们收集了来自12个独立机构的6722例真实临床数据,以及开源数据构建评估数据集。具体而言,Cardiac-CLIP在多个任务上进行全面评估,包括心血管异常分类、信息检索和临床分析。实验结果表明,Cardiac-CLIP在内部和外部数据中的各种下游任务均实现最先进性能。特别是,Cardiac-CLIP在支持复杂临床任务(如急性冠状动脉综合征的前瞻性预测)方面表现出色,这在现实世界情境中是一个极其困难的任务。

关键词

引用

@article{arxiv.2507.22024,
  title  = {Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images},
  author = {Yutao Hu and Ying Zheng and Shumei Miao and Xiaolei Zhang and Jiahao Xia and Yaolei Qi and Yiyang Zhang and Yuting He and Qian Chen and Jing Ye and Hongyan Qiao and Xiuhua Hu and Lei Xu and Jiayin Zhang and Hui Liu and Minwen Zheng and Yining Wang and Daimin Zhang and Ji Zhang and Wenqi Shao and Yun Liu and Longjiang Zhang and Guanyu Yang},
  journal= {arXiv preprint arXiv:2507.22024},
  year   = {2025}
}