中文

多智能体推理结合一致性验证提升医学多选问答中的不确定性校准

人工智能 2026-03-26 v1 计算与语言 机器学习

摘要

校准不良的置信度得分是临床环境中部署 AI 的实际障碍。总是高置信的模型没有什么用处的信号可供 deferral。我们提出了一个多智能体框架,将领域特定专家智能体与 Two-Phase Verification 和 S-Score 加权融合相结合,以提高医学多选问答中的校准和判别能力。四个专家智能体(呼吸、心脏、神经、消化)使用 Qwen2.5-7B-Instruct 生成独立诊断,然后经过两阶段自验证过程,以衡量内部一致性并产生专家置信度得分(S-score)。S-score 驱动加权融合策略,用于选择最终答案并校准报告的置信度。我们在四个实验设置上进行评估,覆盖 MedQA-USMLE 和 MedMCQA 两个数据集中 100 题和 250 题的高不一致子集。校准改进是核心发现,在所有四个设置中 ECE 降低了 49-74%,包括在知识密集型召回要求受限的情况下,这些收益在更难的 MedMCQA 基准测试中仍然保持。在 MedQA-250 上,完整系统实现 ECE = 0.091(相对于单一专家基线降低 74.4%),且 AUROC = 0.630(+0.056),准确率为 59.2%。消融分析确定 Two-Phase Verification 是主要的校准驱动因素,而多智能体推理是主要的准确率驱动因素。这些结果表明,一致性基于的验证在不同医学问题类型中产生更可靠的不确定性估计,为安全关键的临床 AI 应用中的 deferral 提供了实用的置信信号。

关键词

引用

@article{arxiv.2603.24481,
  title  = {Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA},
  author = {John Ray B. Martinez},
  journal= {arXiv preprint arXiv:2603.24481},
  year   = {2026}
}

备注

17 pages, 6 figures. Preprint under review