融合增强型大语言模型:通过模型共识提升诊断可信度
计算与语言
2025-10-21 v1 人工智能
摘要
本研究提出了一种新型多模型融合框架,利用两款最先进的大语言模型(LLM),ChatGPT 与 Claude,来增强肺炎片对 CheXpert 数据集上诊断解释的可靠性。从 224,316 张胸部 X 光片的完整 CheXpert 语料库中,我们随机抽取了 234 例放射科医生标注的研究案例,以图像唯一提示评估单模态性能。在此设置下,ChatGPT 和 Claude 的诊断准确率分别为 62.8% 和 76.9%。采用基于相似性的共识方法(使用 95% 输出相似性阈值),准确率提升至 77.6%。为了评估多模态输入的影响,我们随后生成了遵循 MIMIC-CXR 模板的合成临床记录,并评估了另一随机选取的 50 例病例,每个病例都包含图像和合成文本。在此多模态队列中,ChatGPT 的性能提升至 84%,Claude 为 76%,而共识准确率达到 91.3%。在两种实验条件下,基于一致性的融合方法始终优于单个模型。这一发现凸显了整合互补模态并利用输出级共识提高 AI 辅助放射学诊断可信度和临床实用性的实用价值,为以最小计算开销减少诊断错误提供了可行路径。
引用
@article{arxiv.2510.16057,
title = {Fusion-Augmented Large Language Models: Boosting Diagnostic Trustworthiness via Model Consensus},
author = {Md Kamrul Siam and Md Jobair Hossain Faruk and Jerry Q. Cheng and Huanying Gu},
journal= {arXiv preprint arXiv:2510.16057},
year = {2025}
}
备注
7 pages (Accepted to IEEE BHI 2025)