中文

Meissa:多模态医疗智能体

人工智能 2026-03-11 v1

摘要

多模态大语言模型(MM-LLM)在医学图像理解和临床推理方面表现出强大的性能。最近的医疗智能体系统通过工具使用和多智能体协作扩展了它们,实现复杂的决策。然而,这些系统几乎完全依赖前沿模型(如 GPT),其基于 API 的部署会导致高成本、高延迟和隐私风险,这与现场临床要求相冲突。我们提出 Meissa,一个轻量级的 4B 参数医疗 MM-LLM,使其能够脱机工作。Meissa 通过从前沿模型蒸馏出结构化轨迹,学习何时与外部交互(策略选择)以及如何执行多步骤交互(策略执行)。具体而言,我们提出了:(1)统一轨迹建模:将轨迹(推理和行动痕迹)在统一的状态-动作-观察形式alist中表示,使单个模型能够在异构医疗环境中泛化。(2)三层分层监督:模型自身的错误触发从直接推理到工具增强和多智能体交互的渐进式升级,显式学习难度感知的策略选择。(3)前瞻-回顾监督:将探索性前向轨迹与事后理性化执行轨迹配对,实现有效交互策略的稳定学习。在40K条精选轨迹上训练后,Meissa 在13个医学基准(涵盖放射学、病理学和临床推理)中的16个评估设置中匹配或超越专有前沿智能体。相较于典型的前沿模型如 Gemini-3,使用我们的方法参数数目仅为其25倍以下,端到端延迟降低了22倍。数据、模型和环境已发布于 https://github.com/Schuture/Meissa。

关键词

引用

@article{arxiv.2603.09018,
  title  = {Meissa: Multi-modal Medical Agentic Intelligence},
  author = {Yixiong Chen and Xinyi Bai and Yue Pan and Zongwei Zhou and Alan Yuille},
  journal= {arXiv preprint arXiv:2603.09018},
  year   = {2026}
}