中文

MDIA:基于 HealthBench Professional 的多智能体诊断智能管线

人工智能 2026-05-26 v1 机器学习

摘要

大多数报告的 agentic-LLM 临床基准性能提升归因于提示工程,但我们的实验结果表明,更大的提升可以来自架构和引擎层面的设计。我们提出MDIA(Multi-agent Diagnostic Intelligence Agent),即在完整的 HealthBench Professional 基准(n=525)上实现的 7 节点特色路由临床推理图谱,基于未微调的 LLM 实现。MDIA 在 OpenAI GPT-5.4-2026-03-05 上达到 0.6272,比 OpenAI 的 ChatGPT for Clinicians 高出 3.72 个百分点。实验表明,性能提升归因于系统架构:特色路由、多轮上下文保持、药物状态安全阀、站点过滤搜索、长度感知综合以及引擎层面的可靠性。这些发现支持了 agentic 临床基准性能受制于底层基础模型和编排架构两者的观点。尽管如此,我们也注意到在其他模型作为评分器时存在显著差异;特别是当使用 Gemini 2.5 Pro 时,MDIA 的得分为 0.6585,这表明评分器的选择是导致变异性的来源之一。因此,对 LLMs 进行稳健评估需要在多个独立评分器模型上进行评估。

关键词

引用

@article{arxiv.2605.24699,
  title  = {MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional},
  author = {Roberto Cruz and David Rey-Blanco},
  journal= {arXiv preprint arXiv:2605.24699},
  year   = {2026}
}

备注

33 pages, 10 figures