重新思考罗评生成以提高 LLM 评判和奖励建模用于开放任务
机器学习
2026-02-06 v1 人工智能
摘要
最近,罗评被用于指导 LLM 评判器捕获主观的、细致的、多维的 human 偏好,已从评估扩展到强化微调 (RFT) 的奖励信号。然而,罗评生成仍难以控制:罗评往往缺乏覆盖范围、混合维度、偏离偏好方向,并且包含冗余或高度相关的准则,这会降低评判准确性并在 RFT 中产生次优奖励。我们提出 RRD,即基于递归分解-过滤循环构建的罗评细化原则框架。RRD 将粗糙的罗评分解为细粒度、具辨别力的准则,既扩大覆盖范围又加强响应之间的分离。一个互补的过滤机制移除偏离和冗余的罗评,一个 correlation-aware 加权方案防止高度相关准则的过度代表,从而产生信息丰富、覆盖全面且不冗余的罗评集合。实验方面,RRD 在评估和训练中均实现显著、持续的提升:它在 JudgeBench 和 PPE 上提高了 GPT-4o 和 Llama3.1-405B 评判器的偏好判断准确性,所有设置下均达到最佳性能,最高可提升 17.7 分。当用作 WildChat RFT 的奖励来源时,可获得显著更强、更稳定的学习信号,对 Qwen3-4B 提升最高可达 160%,对 Llama3.1-8B 提升 60%,而先前的罗评基线仅提升 10-20%,且收益可迁移至 HealthBench-Hard 和 BiGGen Bench。总体而言,RRD 确立了递归罗评细化作为开放域 LLM 评判和奖励建模可扩展且可解释基础的潜力。
引用
@article{arxiv.2602.05125,
title = {Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks},
author = {William F. Shen and Xinchi Qiu and Chenxi Whitehouse and Lisa Alazraki and Shashwat Goel and Francesco Barbieri and Timon Willi and Akhil Mathur and Ilias Leontiadis},
journal= {arXiv preprint arXiv:2602.05125},
year = {2026}
}