MARCUS:用于心脏诊断与管理的智能多模态视觉语言模型
人工智能
2026-03-24 v1
摘要
心血管疾病是全球死亡的主要原因,由于人类对复杂心脏测试的解读限制,进步受到阻碍。当前的人工智能视觉语言模型仅支持单一模态输入且缺乏交互性。我们提出MARCUS(Multimodal Autonomous Reasoning and Chat for Ultrasound and Signals),即一个用于心脏超声图、心电图(ECG)和心脏磁共振成像(CMR)独立及多模态输入端到端解读的智能体视觉语言系统。MARCUS采用分层智能体架构,包含各模态-specific 视觉语言专家模型,每个模型将域训练的视觉编码器与多阶段语言模型优化相结合,由多模态 orchestrator 协调。该系统基于1350万张图像(0.25百万ECG、130万超声图、1200万CMR图像)及我们新构建的覆盖160万个问题的专家精选数据集进行训练,MARCUS实现了在GPT-5 Thinking、Gemini 2.5 Pro Deep Think等前沿模型之上表现的国际先进水平。在内部(斯坦福)和外部(UCSF)测试队列中,MARCUS对ECG、超声心动图和CMR的准确率分别为87%-91%、67%-86%和85%-88%,相较前沿模型提升34%-45%(P<0.001)。在多模态案例中,MARCUS达到70%的准确率,几乎是前沿模型(22%-28%)的3倍,且自由文本质量评分提高1.7-3.0倍。我们的智能体架构还能抵御mirage推理,即视觉语言模型从意外的文本信号或幻觉视觉内容中进行推理。MARCUS表明,域特定视觉编码器配合智能体 orchestrator 可实现多模态心脏解读。我们将公开模型、代码及基准测试。
引用
@article{arxiv.2603.22179,
title = {MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management},
author = {Jack W O'Sullivan and Mohammad Asadi and Lennart Elbe and Akshay Chaudhari and Tahoura Nedaee and Francois Haddad and Michael Salerno and Li Fe-Fei and Ehsan Adeli and Rima Arnaout and Euan A Ashley},
journal= {arXiv preprint arXiv:2603.22179},
year = {2026}
}