中文

CURE:面向医学问答的置信度驱动统一推理集成框架

计算与语言 2025-10-17 v1 人工智能 医学物理

摘要

高性能医学大语言模型(LLM)通常需要 extensive fine-tuning 并且需要大量计算资源,这限制了资源受限的医疗机构的可及性。本研究引入一种置信度驱动的多模型框架,利用模型多样性在不进行 fine-tuning 的情况下提升医学问答性能。该框架采用两阶段架构:置信度检测模块评估主模型的确定性,自适应路由机制将低置信度查询导向具有互补知识的辅助模型进行协作推理。我们使用 Qwen3-30B-A3B-Instruct、Phi-4 14B 和 Gemma 2 12B 三个模型,在三个医学基准测试(MedQA、MedMCQA 和 PubMedQA)上进行评估。结果表明,该框架取得了具竞争力的性能,尤其在 PubMedQA(95.0%)和 MedMCQA(78.0%)上表现尤为突出。消融研究确认,置信度感知的路由结合多模型协作显著优于单模型方法和统一推理策略。这一工作表明,战略性的模型协作为改善医学 AI 系统提供了一条实用且计算效率高的路径,对于在资源受限环境中 democratizing 访问先进医学 AI 具有重大意义。

关键词

引用

@article{arxiv.2510.14353,
  title  = {CURE: Confidence-driven Unified Reasoning Ensemble Framework for Medical Question Answering},
  author = {Ziad Elshaer and Essam A. Rashed},
  journal= {arXiv preprint arXiv:2510.14353},
  year   = {2025}
}