中文

多维评分导向奖励模型学习:通过几何投影参考约束

人工智能 2025-12-05 v3

摘要

将大型语言模型(LLMs)集成到医疗实践中具有变革性潜力,但其实际临床适用性仍受到关键对齐问题的制约:(1)静态评估基准与临床实践中动态认知需求之间存在偏差;(2)适应不断演变、多源医疗标准的挑战;(3)传统奖励模型容量有限,难以反映细粒度的多维医疗质量标准。为克服这些限制,我们引入了 MR-RML(Multidimensional Rubric-oriented Reward Model Learning),配合 GPRC(Geometric Projection Reference Constraints)——一种新型对齐框架,将医疗标准结构化为多视角矩阵,以指导数据生成与模型优化。我们的方法引入了三个关键创新:(1)医疗标准系统在整个训练管道中嵌入领域特定指南;(2)独立的多维奖励模型分解评估标准,从规则驱动或 LLM 驱动的评分转向内化奖励建模,以提升评估性能;(3)几何投影参考约束将临床认知逻辑转化为数学正则化,将评分梯度与临床推理对齐,并促进使用合成数据的训练。广泛的在Healthbench权威医疗基准上的评估表明,我们的方法显著提升了基座 Qwen-32B 模型的性能,在完整子集上提升 45%,在困难子集上提升 85%。实现开源 LLMs 的最先进成绩,分别在完整子集得分 62.7 分,困难子集得分 44.7 分,同时超过了大多数封闭源模型。

关键词

引用

@article{arxiv.2511.16139,
  title  = {Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints},
  author = {Yongnan Jin and Xurui Li and Feng Cao and Liucun Gao and Juanjuan Yao},
  journal= {arXiv preprint arXiv:2511.16139},
  year   = {2025}
}