第二意见很重要:基于专家模型集成共识的自适应临床 AI
人工智能
2025-06-24 v2 机器学习
摘要
尽管大型语言模型(LLM)在临床上的应用日益广泛,但目前的方法严重依赖单一模型架构。为了克服单一模型系统过时的风险和对其的僵化依赖,我们提出了一个名为共识机制的新框架。共识机制模拟临床分诊和多学科临床决策,实现了一组专业医疗专家智能体的集成,从而在保持稳健适应性的同时改善临床决策。该架构使共识机制能够纯粹基于其内部模型配置,针对成本、延迟或性能进行优化。为了严格评估共识机制,我们采用了三个医学评估基准:MedMCQA、MedQA 和 MedXpertQA Text,以及鉴别诊断数据集 DDX+。在 MedXpertQA 上,共识机制的准确率达到 61.0%,而 OpenAI 的 O3 和 Google 的 Gemini 2.5 Pro 分别为 53.5% 和 45.9%。这种改进在各个基准测试中保持一致,在 MedQA()和 MedMCQA()上的准确率均有提高。这些准确率的提升也延伸到鉴别诊断生成,其中我们的系统表现出更高的召回率和精确率(F1 = 0.326 vs. F1 = 0.2886),以及更高的 DDX top-1 准确率(Top1 = 52.0% vs. Top1 = 45.2%)。
引用
@article{arxiv.2505.23075,
title = {Second Opinion Matters: Towards Adaptive Clinical AI via the Consensus of Expert Model Ensemble},
author = {Amit Kumthekar and Zion Tilley and Henry Duong and Bhargav Patel and Michael Magnoli and Ahmed Omar and Ahmed Nasser and Chaitanya Gharpure and Yevgen Reztzov},
journal= {arXiv preprint arXiv:2505.23075},
year = {2025}
}
备注
23 pages, 11 figures