中文

EchoVLM: 基于测量驱动的多模态学习用于超声心动图

计算机视觉与模式识别 2025-12-16 v1

摘要

超声心动图是心脏病学中使用最广泛的成像方式,但其解读仍然劳动密集且本质上具有多模态特性,需要视图识别、定量测量、定性评估和基于指南的推理。尽管近期的视觉-语言模型(VLM)在自然图像和某些医学领域取得了广泛成功,但其在超声心动图中的潜力受到缺乏大规模、临床基础的图像-文本数据集以及缺乏超声心动图解读核心的基于测量的推理的限制。我们引入了EchoGround-MIMIC,这是第一个基于测量驱动的多模态超声心动图数据集,包含来自1,572名患者的19,065对图像-文本对,具有标准化视图、结构化测量、基于测量的描述和基于指南的疾病标签。基于这一资源,我们提出了EchoVLM,一种视觉-语言模型,包含两个新颖的预训练目标:(i)一种视图感知的对比损失,用于编码超声心动图成像的视图依赖结构;(ii)一种否定感知的对比损失,用于区分临床关键的阴性发现与阳性发现。在涵盖多模态疾病分类、图像-文本检索、视图分类、腔室分割和关键点检测等五种临床应用的36项任务中,EchoVLM取得了最先进性能(零样本疾病分类AUC达86.5%,视图分类准确率达95.1%)。我们证明,基于临床基础的多模态预训练产生了可迁移的视觉表征,并将EchoVLM确立为端到端超声心动图解读的基础模型。我们将发布EchoGround-MIMIC和数据整理代码,以确保可重复性并推动多模态超声心动图解读的进一步研究。

关键词

引用

@article{arxiv.2512.12107,
  title  = {EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography},
  author = {Yuheng Li and Yue Zhang and Abdoul Aziz Amadou and Yuxiang Lai and Jike Zhong and Tiziano Passerini and Dorin Comaniciu and Puneet Sharma},
  journal= {arXiv preprint arXiv:2512.12107},
  year   = {2025}
}