MedS3:面向医学慢思考的自演化软双侧过程监督
计算与语言
2025-11-26 v4
摘要
医学语言模型面临现实临床推理应用的关键障碍。然而,现有主流方法在任务覆盖范围不足、缺乏对中间推理步骤的细粒度监督,以及依赖专有系统等问题,仍远非通用、可信且高效的临床推理语言模型所需。为此,我们提出MedS3,一个自演化框架,为小型可部署模型赋予稳健的推理能力。该框架基于跨越五个医学领域和16个数据集筛选的8000个精心挑选的实例,采用 curriculum 策略进行采样。我们使用小型 base policy 模型通过蒙特卡洛树搜索(MCTS)构建可验证的推理轨迹。按节点价值排序后的自探索推理轨迹用于强化微调和偏好学习来引导 policy 模型。此外,我们引入一种软双进程奖励模型,融合价值动态:对降低节点价值的步骤进行惩罚,从而即使最终答案正确,也能精细识别推理错误。十一个基准实验表明,MedS3相比前一代医学 SOTA 模型提升了+6.45个准确度点,超越了320亿参数规模的通用推理模型+8.57个点。额外的实证分析进一步表明,MedS3实现了稳健且可信的推理行为。
引用
@article{arxiv.2501.12051,
title = {MedS$^3$: Towards Medical Slow Thinking with Self-Evolved Soft Dual-sided Process Supervision},
author = {Shuyang Jiang and Yusheng Liao and Zhe Chen and Ya Zhang and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2501.12051},
year = {2025}
}
备注
20 pages;Accepted as a Main paper at AAAI26