解构医学大型语言模型中的推理与知识
计算与语言
2025-06-25 v2 人工智能
摘要
医学推理旨在模拟临床医生的诊断思维,但当前基准测试如 MedQA-USMLE、MedMCQA 和 PubMedQA 常将推理与事实记忆混合在一起。我们通过使用达到 81% 准确率的 PubMedBERT 分类器将 11 个生物医学 QA 基准测试分为推理和知识聚焦子集来解决此问题。我们的分析表明,仅 32.8% 的问题需要复杂推理。我们评估了生物医学模型 (HuatuoGPT-o1、MedReason、m1) 和通用领域模型 (DeepSeek-R1、o4-mini、Qwen3),发现知识与推理性能之间存在持续的差距。例如,HuatuoGPT-o1 在知识方面得分 56.9,但仅在推理方面得分 44.8。在模型被误导于错误初始推理的对抗性测试中,生物医学模型性能急剧下降,而更大型或经过强化学习训练的通用模型显示出更大的鲁棒性。为此,我们使用微调和强化学习在以推理为主的示例上训练 BioMed-R1。它在相似规模模型中取得了最强性能。进一步的提升可能来自整合临床病例报告和使用对抗性和回溯情景进行训练。
关键词
引用
@article{arxiv.2505.11462,
title = {Disentangling Reasoning and Knowledge in Medical Large Language Models},
author = {Rahul Thapa and Qingyang Wu and Kevin Wu and Harrison Zhang and Angela Zhang and Eric Wu and Haotian Ye and Suhana Bedi and Nevin Aresh and Joseph Boen and Shriya Reddy and Ben Athiwaratkun and Shuaiwen Leon Song and James Zou},
journal= {arXiv preprint arXiv:2505.11462},
year = {2025}
}