中文

MoMA:多模态智能体混合架构用于提升临床预测建模

机器学习 2025-08-08 v1 人工智能 多智能体系统

摘要

多模态电子健康记录(EHR)数据提供了比单一模态数据更丰富、互补的对患者健康的洞察。然而,有效地整合不同数据模态以进行临床预测建模仍具有挑战,因为需要大量数据。我们引入一种新型架构 Mixture-of-Multimodal-Agents(MoMA),旨在利用多个大型语言模型(LLM)智能体使用多模态 EHR 数据进行临床预测任务。MoMA 采用专用 LLM 智能体将非文本模态(如医学影像和实验室结果)转换为结构化文本摘要。这些摘要与临床笔记一起由另一个 LLM(聚合智能体)生成统一的多模态摘要,然后由第三个 LLM(预测智能体)用于生成临床预测。在使用包含不同模态组合和预测设置的真实世界数据集上评估 MoMA 时,结果表明 MoMA 在各种预测任务中超越了当前的 state-of-the-art 方法,凸显了其在准确性和灵活性方面的优势。

关键词

引用

@article{arxiv.2508.05492,
  title  = {MoMA: A Mixture-of-Multimodal-Agents Architecture for Enhancing Clinical Prediction Modelling},
  author = {Jifan Gao and Mahmudur Rahman and John Caskey and Madeline Oguss and Ann O'Rourke and Randy Brown and Anne Stey and Anoop Mayampurath and Matthew M. Churpek and Guanhua Chen and Majid Afshar},
  journal= {arXiv preprint arXiv:2508.05492},
  year   = {2025}
}