面向医疗 AI 的多智能体框架:利用微调的 GPT、LLaMA 和 DeepSeek R1 实现基于证据且避免偏见的临床查询处理
计算与语言
2026-02-17 v1 人工智能
多智能体系统
摘要
大型语言模型 (LLM) 在医疗问答方面显示出前景,但因验证能力弱、证据 grounding 不足以及置信度信号不可靠而在临床应用中受限。我们提出一种多智能体医疗问答框架,通过结合互补的 LLM、证据检索、不确定性估计和偏见检测来提高答案的可靠性。该方法包含两个阶段。首先,我们在MedQuAD-derived医疗问答数据集 (20k+问答对,覆盖多个NIH领域) 上对三类代表性 LLM (GPT、LLaMA和DeepSeek R1) 进行微调,并评估生成质量。DeepSeek R1取得最强分数 (ROUGE-1 0.536 ± 0.04;ROUGE-2 0.226 ±0.03;BLEU 0.098 ± 0.018),在零样本评估中显著超越专用医学基线 BioGPT。其次,我们实现一个模块化的多智能体管线,其中临床推理智能体 (微调的LLaMA) 生成结构化解释,证据检索智能体查询PubMed以将响应锚定在最新文献中,精炼智能体 (DeepSeek R1) 改进清晰度和事实一致性;可选的人类验证路径在高风险或高不确定性情况下被触发。安全机制包括蒙特卡洛 dropout 和基于困惑度的不确定性评分,外加基于词汇和情感的偏见检测,支持LIME/SHAP分析。在评估中,完整系统实现87%的准确率,相关性约为0.80,证据增强显著降低不确定性 (困惑度4.13),相较于基础响应;端到端平均延迟为36.5秒。总体而言,结果表明,智能体专业化和验证层可缓解单一模型的关键局限,为基于证据且避免偏见的医疗 AI 提供实用且可扩展的设计。
引用
@article{arxiv.2602.14158,
title = {A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing},
author = {Naeimeh Nourmohammadi and Md Meem Hossain and The Anh Han and Safina Showkat Ara and Zia Ush Shamszaman},
journal= {arXiv preprint arXiv:2602.14158},
year = {2026}
}
备注
27 pages, 14 figures, 5 tables