多视图经胸超声影像解释的 Video CLIP 模型
计算机视觉与模式识别
2025-11-11 v3 人工智能
摘要
经胸超声记录心脏的超声视频,使临床医生能够评估心脏功能。近期大规模视觉语言模型(VLM)的进展推动了自动化经胸超声解读的兴趣。然而,大多数现有医学 VLM 仅依赖单帧(图像)输入,可能降低针对仅通过心脏运动可诊断的疾病的诊断准确性。此外,经胸超声视频是从多个视角拍摄的,每种视角对于检测特定疾病的适用性各不相同。因此,利用多视图可能有助于提高诊断性能。我们开发了一个处理来自五个标准视角的完整视频序列的视频语言模型,在 60,747 对经胸超声视频-报告对上进行训练。我们评估了视频输入和多视图支持对检索性能提升的贡献,包括各种预训练模型的影响。代码和模型权重可在 https://github.com/UTcardiology/video-echo-clip 获取。
关键词
引用
@article{arxiv.2504.18800,
title = {Video CLIP Model for Multi-View Echocardiography Interpretation},
author = {Ryo Takizawa and Satoshi Kodera and Tempei Kabayama and Ryo Matsuoka and Yuta Ando and Yuto Nakamura and Haruki Settai and Norihiko Takeda},
journal= {arXiv preprint arXiv:2504.18800},
year = {2025}
}