中文

MARCUS:用于心脏诊断与管理的智能多模态视觉语言模型

人工智能 2026-03-24 v1

摘要

心血管疾病是全球死亡的主要原因,由于人类对复杂心脏测试的解读限制,进步受到阻碍。当前的人工智能视觉语言模型仅支持单一模态输入且缺乏交互性。我们提出MARCUS(Multimodal Autonomous Reasoning and Chat for Ultrasound and Signals),即一个用于心脏超声图、心电图(ECG)和心脏磁共振成像(CMR)独立及多模态输入端到端解读的智能体视觉语言系统。MARCUS采用分层智能体架构,包含各模态-specific 视觉语言专家模型,每个模型将域训练的视觉编码器与多阶段语言模型优化相结合,由多模态 orchestrator 协调。该系统基于1350万张图像(0.25百万ECG、130万超声图、1200万CMR图像)及我们新构建的覆盖160万个问题的专家精选数据集进行训练,MARCUS实现了在GPT-5 Thinking、Gemini 2.5 Pro Deep Think等前沿模型之上表现的国际先进水平。在内部(斯坦福)和外部(UCSF)测试队列中,MARCUS对ECG、超声心动图和CMR的准确率分别为87%-91%、67%-86%和85%-88%,相较前沿模型提升34%-45%(P<0.001)。在多模态案例中,MARCUS达到70%的准确率,几乎是前沿模型(22%-28%)的3倍,且自由文本质量评分提高1.7-3.0倍。我们的智能体架构还能抵御mirage推理,即视觉语言模型从意外的文本信号或幻觉视觉内容中进行推理。MARCUS表明,域特定视觉编码器配合智能体 orchestrator 可实现多模态心脏解读。我们将公开模型、代码及基准测试。

关键词

引用

@article{arxiv.2603.22179,
  title  = {MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management},
  author = {Jack W O'Sullivan and Mohammad Asadi and Lennart Elbe and Akshay Chaudhari and Tahoura Nedaee and Francois Haddad and Michael Salerno and Li Fe-Fei and Ehsan Adeli and Rima Arnaout and Euan A Ashley},
  journal= {arXiv preprint arXiv:2603.22179},
  year   = {2026}
}