MedMASLab:面向多模态医学多智能体系统的统一编排框架与基准测试平台
人工智能
2026-03-20 v2
摘要
尽管多智能体系统(MAS)在复杂临床决策支持方面显示出潜力,但该领域仍受制于架构碎片化及缺乏标准化的多模态集成。当前医学MAS研究面临数据摄取管道不统一、视觉推理评估不一致以及缺乏跨 specialty 基准测试的问题。为此,我们提出MedMASLab——面向多模态医学多智能体系统的统一框架与基准测试平台。MedMASLab引入了:(1)标准化的多模态智能体通信协议,使可无缝集成11种异构MAS架构,覆盖24种医学模态;(2)自动化临床推理评估器,一种零样本语义评估范式,通过利用大型视觉语言模型来验证诊断逻辑与视觉 grounding,克服传统词汇字符串匹配的局限性;(3)目前为止最全面的基准测试,涵盖11个器官系统和473种疾病,统一来自11个临床基准的数据。我们的系统评估揭示了一个关键的领域特定性能差距:尽管MAS在推理深度方面有所提升,但当前架构在跨越专门医学子域时表现出显著的脆弱性。我们对交互机制及成本-性能权衡进行了严格的消融分析,为未来自主临床系统建立了新的技术基准。源代码与数据已公开于:https://github.com/NUS-Project/MedMASLab/。
引用
@article{arxiv.2603.09909,
title = {MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems},
author = {Yunhang Qian and Xiaobin Hu and Jiaquan Yu and Siyang Xin and Xiaokun Chen and Jiangning Zhang and Peng-Tao Jiang and Jiawei Liu and Hongwei Bran Li},
journal= {arXiv preprint arXiv:2603.09909},
year = {2026}
}