基于多智能体大语言模型框架用于自动评估临床AI分诊工具性能
计算与语言
2025-10-31 v1
摘要
目的:本研究旨在确定多个大语言模型(LLM)智能体集合是否能提供比单个LLM更可靠的评估。方法:将来自14家医院的29,766例非对比头颈CT检查送至商业颅内出血(ICH)AI检测工具处理。由八个开源LLM模型和一个符合HIPAA标准的内部GPT-4o版本组成的ensemble团队使用单一的多次提示评估是否存在ICH。手动审核了1,726个案例。比较八个开源模型和共识结果与GPT-4o的性能特征。测试了三个理想的LLM组合用于评估分诊工具的性能。结果:该队列包含29,766例头颈CT检查-报告配对。llama3.3:70b和GPT-4o实现了最高的AUC性能(AUC=0.78)。平均精度在llama3.3:70b和GPT-4o(AP=0.75与0.76)方面最高。llama3.3:70b具有最高的F1分数(0.81)和召回率(0.85),更高的精度(0.78)、特异度(0.72)和MCC(0.57)。使用MCC(95%置信区间),理想的LLM组合为:Full-9 Ensemble 0.571(0.552-0.591),Top-3 Ensemble 0.558(0.537-0.579),Consensus 0.556(0.539-0.574),GPT4o 0.522(0.500-0.543)。在Top-3、Full-9和Consensus之间未观察到统计学显著差异(p>0.05)。结论:由中等至大型开源LLM组成的ensemble提供了比单个LLMalone更一致可靠的方法,用于对临床AI分诊工具进行回顾性地场真值评估。
引用
@article{arxiv.2510.26498,
title = {A Multi-agent Large Language Model Framework to Automatically Assess Performance of a Clinical AI Triage Tool},
author = {Adam E. Flanders and Yifan Peng and Luciano Prevedello and Robyn Ball and Errol Colak and Prahlad Menon and George Shih and Hui-Ming Lin and Paras Lakhani},
journal= {arXiv preprint arXiv:2510.26498},
year = {2025}
}
备注
29 pages, 3 figures, 4 tables