中文

Clinical-R1:通过临床目标相对策略优化实现大型语言模型的忠实与全面推理

人工智能 2025-12-04 v2

摘要

近期大型语言模型(LLM)的进展通过大规模预训练和后训练强化学习显示出强大的推理能力,DeepSeek-R1 已证明这一点。然而,当前的后训练方法,如分组相对策略优化(GRPO),主要奖励正确性,而在医学等高风险领域所需的多维目标并未得到满足,在这些领域中,推理必须也是忠实且全面的。我们引入临床目标相对策略优化(CRPO),这是一种可扩展的、多目标的、可验证的强化学习方法,旨在将 LLM 后训练与临床推理原则对齐。CRPO 集成了基于规则和可验证的奖励信号,联合优化准确性、忠实性和全面性,而无需依赖人工标注。为展示其有效性,我们训练了 Clinical-R1-3B,这是一个用于临床推理的 3B 参数模型。对三个基准的实验表明,CRPO 在标准 GRPO 之上显著提升了 truthfulness 和完整性推理,同时保持了舒适的准确性提升。这一框架为将 LLM 推理与临床目标对齐提供了可扩展的路径,使医疗保健领域的更安全、更协作的 AI 系统成为可能,同时也凸显了多目标、可验证 RL 方法在医学领域 LLM 后训练规模化中的潜力。

关键词

引用

@article{arxiv.2512.00601,
  title  = {Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization},
  author = {Boyang Gu and Hongjian Zhou and Bradley Max Segal and Jinge Wu and Zeyu Cao and Hantao Zhong and Lei Clifton and Fenglin Liu and David A. Clifton},
  journal= {arXiv preprint arXiv:2512.00601},
  year   = {2025}
}