量化 LLM 在真实临床病例中的推理能力
计算与语言
2025-03-11 v2
摘要
近期,深度推理增强型大语言模型(LLM)如 DeepSeek-R1 和 OpenAI-o3 取得了显著进展。然而,其在专业医学情境中的应用尚未得到充分探索,尤其是评估其推理过程质量而不仅仅是最终输出。为此,我们引入 MedR-Bench,这是一个包含 1,453 个结构化患者病例的数据集,标注包括从临床病例报告中派生的推理参考答案。数据集涵盖 13 种身体部位和 10 个专科,包括常见病和罕见病。为全面评估 LLM 性能,我们提出了包含三个关键考察要素的框架:诊检建议、诊断决策和治疗规划,模拟整个患者护理过程。为评估推理质量,我们提出了 Reasoning Evaluator,这是一个新型自动化系统,通过动态交叉引用和证据检查,客观地对自由文本推理响应进行效率、实际性和完整性的评分。在使用该基准测试评估五种最先进的推理 LLM(包括 DeepSeek-R1、OpenAI-o3-mini 和 Gemini-2.0-Flash Thinking 等)后,我们发现当前 LLM 在获得充分诊检结果后,即可在相对简单的诊断任务中实现超过 85% 的准确率。然而,在诊检建议和治疗规划等更复杂的任务中,性能会下降。尽管推理输出通常可靠,事实性得分超过 90%,但经常遗漏关键推理步骤。这些发现凸显了临床 LLM 的进步与局限。值得注意的是,开源模型如 DeepSeek-R1 正在缩小与专有系统之间的差距,凸显其在推动医疗保健可及且公平的进步方面的潜力。
引用
@article{arxiv.2503.04691,
title = {Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases},
author = {Pengcheng Qiu and Chaoyi Wu and Shuyu Liu and Weike Zhao and Zhuoxia Chen and Hongfei Gu and Chuanjin Peng and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2503.04691},
year = {2025}
}