中文

EchoPrime:基于多视频视图信息的综合性心脏超声解释视觉语言模型

计算机视觉与模式识别 2024-10-15 v1 机器学习

摘要

心脏超声是最广泛使用的心脏成像模态,捕获 ultrasound 视频数据以评估心脏结构和功能。人工智能(AI)在心脏超声领域的潜力在于简化手动任务、提高可重复性和精确性。然而,大多数心脏超声 AI 模型是单视图、单任务系统,无法综合来自完整检查期间多个视图的互补信息,从而导致性能有限和应用范围受限。为解决此问题,我们引入 EchoPrime,一个基于多视图、视图感知、基于视频的视觉语言基础模型,训练于超过 1200 万视频-报告对。EchoPrime 使用对比学习训练统一的嵌入模型,用于综合心脏超声检查中所有标准视图的表示,涵盖罕见和常见疾病及诊断。EchoPrime 然后利用视图分类和视图感知解剖注意力模型,对视频特定解释进行加权,以准确地映射心脏超声视图与解剖结构之间的关系。通过检索增强解释,EchoPrime 整合了综合心脏超声检查中所有视频信息,进行整体性综合临床心脏超声解释。在来自两个独立医疗系统的数据集中,EchoPrime 在 23 个多样化的心脏形态和功能基准测试中实现了最先进的性能,超越了任务特定方法和先前基础模型的性能。经过严格的临床评估,EchoPrime 可帮助医生进行心脏超声综合性初步评估。

关键词

引用

@article{arxiv.2410.09704,
  title  = {EchoPrime: A Multi-Video View-Informed Vision-Language Model for Comprehensive Echocardiography Interpretation},
  author = {Milos Vukadinovic and Xiu Tang and Neal Yuan and Paul Cheng and Debiao Li and Susan Cheng and Bryan He and David Ouyang},
  journal= {arXiv preprint arXiv:2410.09704},
  year   = {2024}
}

备注

30 pages, 3 tables, 3 figures