中文

MAPLE:从统计共识提升到过程导向对齐的医学推理

机器学习 2026-03-11 v1

摘要

近期医学大型语言模型的进展探索了测试时强化学习(TTRL)以增强推理。然而,标准TTRL常依赖多数投票(MV)作为启发式监督信号,在复杂医学场景中可能不可靠,因为最频繁的推理路径未必是临床上正确的。在本工作中,我们提出一种新颖且统一的训练范式,将医学过程奖励模型与TTRL集成,以弥合测试时扩张(TTS)与参数模型优化之间的差距。具体而言,我们通过替换常规MV为基于Med-RPM的细粒度、专家对齐的监督范式,推进了TTRL框架。这种集成确保强化学习由医学正确性而非单纯共识引导,有效将基于搜索的智能蒸馏到模型的参数记忆中。对四个不同基准的广泛评估表明,我们开发的方法在当前TTRL和独立PRM选择方面 consistently and显著优于。我们的发现表明,从随机启发式转向结构化、分步骤奖励对于开发可靠且可扩展的医学AI系统至关重要。

关键词

引用

@article{arxiv.2603.08987,
  title  = {MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment},
  author = {Kailong Fan and Anqi Pu and Yichen Wu and Wanhua Li and Yicong Li and Hanspeter Pfister and Huafeng Liu and Xiang Li and Quanzheng Li and Ning Guo},
  journal= {arXiv preprint arXiv:2603.08987},
  year   = {2026}
}