MedCritical:通过自我协作纠正提升小型语言模型的医学推理能力
计算与语言
2025-09-30 v1 人工智能
摘要
在医学领域,复杂的推理任务如临床诊断、治疗计划和医学知识整合都提出了显著的挑战,其中小型语言模型往往表现不佳,尤其是相较于 GPT-4 和 Deepseek 等大型语言模型。在知识蒸馏方法方面,旨在通过教师引导的纠错来解决这些问题,但这种 LLM 作为评判家的方法在成本、时间和效率方面仍具有挑战性。为规避此问题,我们提出了一种新型双阶段框架 MedCritical,该框架使用由大型教师模型微调的小型语言模型对其自身进行博弈。在第一个阶段,我们从教师模型中提取高层和详细的长链思维模板,以指导学生模型生成更复杂的推理思维。在第二个阶段,我们通过模型自迭代协作引入直接偏好优化(DPO),以增强学生模型的推理能力,方法是通过博弈训练中对精炼模型的纠正轨迹进行训练。这种模型自学习 DPO 方法教导学生模型使用其自身的 error-driven 洞察来巩固技能和知识,以解决复杂问题,同时在较低成本下实现了与传统知识蒸馏方法相当的结果。值得注意的是,我们的MedCritical 7B 模型在CMExam基准测试中分别 outperform Taiyi 和 Huatuo-o1-7B 模型 3.04% 和 10.12%,实现了7B 类小型模型的全新SOTA性能。
引用
@article{arxiv.2509.23368,
title = {MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction},
author = {Xinchun Su and Chunxu Luo and Yixuan Li and Weidong Yang and Lipeng Ma},
journal= {arXiv preprint arXiv:2509.23368},
year = {2025}
}