中文

用于超声心动图解读的多模态基础模型

计算机视觉与模式识别 2023-09-06 v2 人工智能

摘要

多模态深度学习基础模型可以学习图像与文本之间的关系。在医学影像背景下,将图像映射到语言概念反映了诊断性图像解读的临床任务,然而当前通用基础模型在此背景下表现不佳,因为其训练语料中医学文本和图像有限。为应对这一挑战并涵盖心脏生理的多样性,我们利用 1,032,975 个心脏超声视频及相应的专家解读,开发了 EchoCLIP,一个用于超声心动图的多模态基础模型。EchoCLIP 在心脏功能评估中展现出强大的零样本(未显式训练)性能(外部验证左心室射血分数平均绝对误差(MAE)为 7.1%),并能识别植入式心脏内装置(起搏器和人工心脏瓣膜的曲线下面积(AUC)介于 0.84 和 0.98 之间)。我们还开发了一个长上下文变体(EchoCLIP-R),其带有定制的超声心动图报告文本分词器,可跨多个视频准确识别唯一患者(AUC 为 0.86),识别临床变化如原位心脏移植(AUC 为 0.79)或心脏手术(AUC 为 0.77),并实现鲁棒的图像到文本检索(候选文本报告中的平均跨模态检索排名位于前 1%)。这些涌现能力可用于超声心动图发现的初步评估和总结。

关键词

引用

@article{arxiv.2308.15670,
  title  = {Multimodal Foundation Models For Echocardiogram Interpretation},
  author = {Matthew Christensen and Milos Vukadinovic and Neal Yuan and David Ouyang},
  journal= {arXiv preprint arXiv:2308.15670},
  year   = {2023}
}