中文

面向 LLM 评估的回归感知强化学习

机器学习 2026-03-19 v1 人工智能

摘要

大型语言模型(LLM)日益被用于自动评估器,为模型输出分配数值分数,形成 LLM-as-a-Judge 范式。然而,标准强化学习方法通常依赖二元奖励(如 0-1 正确性),忽略了回归任务中固有的序数结构;例如,他们难以识别当真实值为 5 时,预测 4 的优势远大于预测 1。相反,现有的回归感知方法往往局限于监督微调(SFT),限制了其探索最优推理路径的能力。为弥合这一差距,我们提出了 REAL(\underline{RE}gression-\underline{A}ware \underline{L}earning \underline{E}xpert)框架,这是一个原则性的 RL 框架,旨在优化回归奖励,亦可证明其对相关性指标最优。关键技术挑战在于,回归目标显式依赖于策略,从而使标准策略梯度方法失效。为此,我们采用广义策略梯度估计器,自然地将优化分解为两个互补组成部分:(1) 对链式思维(Chain-of-Thought, CoT)轨迹的探索;(2) 对最终得分的回归感知预测细化。广泛的实验覆盖模型规模(8B 至 32B),结果表明 REAL 在所有模型规模上均优于回归感知 SFT 基线和标准 RL 方法,在跨域基准测试上显示出显著更好的泛化能力。具体而言,以 Qwen3-32B 为例,REAL 相对于 SFT 基线在 Pearson 与 Spearman 相关系数上分别提升了 +8.40 与 +7.20,相对于基础模型则提升了 +18.30 与 +11.20。这些发现凸显了将回归目标整合至 RL 探索中以实现精准 LLM 评估的关键价值。

关键词

引用

@article{arxiv.2603.17145,
  title  = {REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge},
  author = {Yasi Zhang and Tianyu Chen and Mingyuan Zhou and Oscar Leong and Ying Nian Wu and Michal Lukasik},
  journal= {arXiv preprint arXiv:2603.17145},
  year   = {2026}
}