中文

Ultrasound-CLIP:面向超声图像-文本理解的语义感知对比预训练

计算机视觉与模式识别 2026-04-03 v1

摘要

超声成像因其实时能力和无辐射特性而被广泛用于临床诊断。然而,现有的视觉-语言预训练模型(如CLIP)主要针对其他模态设计,难以直接应用于超声数据,后者表现出异质性的解剖结构和多样化的诊断属性。为弥合这一差距,我们构建了US-365K,一个包含52个解剖类别共36.5万对样本的大规模超声图像-文本数据集。我们建立了包含两个层次化知识框架的超声诊断分类体系(UDT)。超声分层解剖分类体系规范化解剖组织方式,超声诊断属性框架形式化了九个诊断维度,包括身体系统、器官、诊断、形状、边缘、回声特性、内部特征、后部声像现象和血管化。在此基础上,我们提出了Ultrasound-CLIP,一个语义感知的对比学习框架,引入语义软标签和语义损失来细化样本区分。此外,我们从UDAT的文本表示构建了一个异构图模态,使病变-属性关系的结构化推理成为可能。大量采用患者级数据划分的实验表明,我们的方法在分类和检索基准上达到了最先进的性能,同时在零样本、线性探测和微调任务中也展现出强大的泛化能力。

关键词

引用

@article{arxiv.2604.01749,
  title  = {Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding},
  author = {Jiayun Jin and Haolong Chai and Xueying Huang and Xiaoqing Guo and Zengwei Zheng and Zhan Zhou and Junmei Wang and Xinyu Wang and Jie Liu and Binbin Zhou},
  journal= {arXiv preprint arXiv:2604.01749},
  year   = {2026}
}

备注

Accepted by CVPR 2026