LLM 中的医学推理:对 DeepSeek R1 的深入分析
计算与语言
2025-04-02 v1
摘要
将 DeepSeek R1 等大语言模型(LLM)整合到医疗保健领域,需要严格评估其推理与临床专业知识的对齐程度。本研究使用 100 个 MedQA 临床病例,评估了 DeepSeek R1 相对于专家模式的医学推理能力。该模型达到了 93% 的诊断准确率,通过鉴别诊断、基于指南的治疗选择以及整合患者特异性因素,展示了系统性的临床判断能力。然而,对七个错误病例的误差分析揭示了持续存在的局限性:锚定偏差、调和冲突数据的挑战、对替代方案探索不足、过度思考、知识盲区,以及过早优先考虑最终治疗而非中间护理。关键的是,推理长度与准确率相关——较短的回复(<5,000 字符)更为可靠,这表明过长的解释可能是不确定性或对错误的合理化。虽然 DeepSeek R1 展现出基础的临床推理能力,但反复出现的缺陷凸显了亟待改进的关键领域,包括偏差缓解、知识更新和结构化推理框架。这些发现强调了 LLM 通过人工推理增强医疗决策的潜力,但也强调需要领域特定验证、可解释性保障措施和置信度指标(如回复长度阈值),以确保在真实世界应用中的可靠性。
引用
@article{arxiv.2504.00016,
title = {Medical Reasoning in LLMs: An In-Depth Analysis of DeepSeek R1},
author = {Birger Moell and Fredrik Sand Aronsson and Sanian Akbar},
journal= {arXiv preprint arXiv:2504.00016},
year = {2025}
}