高效在线 RFT 采用即插即用 LLM 裁判:实现最新性能
机器学习
2025-06-09 v1 人工智能
摘要
奖励模型训练是现代强化学习人类反馈(RLHF)管道中的成本瓶颈,常需数千亿参数以及离线偏好调优阶段。所提出的方法中,一个冻结的、指令微调的7B LLM仅通过一条 JSON 评估标准和一个秩为16的 LoRA 适配器(仅影响模型参数的0.8%)即可增强,使其作为先前使用的重型评估模型的完整替代品。即插即用裁判在 RewardBench 上实现96.2%的准确率,超越了参数范围从27B到70B的专用奖励网络。此外,它允许一个7B actor 超越顶级70B DPO 基线(得分为61.8%),通过在 GSM-8K 上实现92%的精确匹配准确率来实现在线 PPO。详尽的消融实验表明:(i) 6个零样本演示提供了大部分的零到少样本改进(+2pp),(ii) LoRA 有效解决了剩余差距,尤其在安全和对抗性 Chat-Hard 区域。该模型引入了 HH-Rationales,一个来自 Anthropic HH-RLHF 中10,000对样本的子集,用于检验可解释性,伴随人类生成的依据。GPT-4 评分表明,我们的 LoRA 裁判在与人类解释的相似度上大约为9/10,而零样本裁判约为5/10。这一结果表明,提示工程与微小 LoRA 的组合产生了高性价比、透明且易于调整的奖励函数,在实现静态评估和在线 RLHF 的新最新成果方面均无需离线阶段。
引用
@article{arxiv.2506.05748,
title = {Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance},
author = {Rudransh Agnihotri and Ananya Pandey},
journal= {arXiv preprint arXiv:2506.05748},
year = {2025}
}