中文

RM-Distiller: 利用生成式LLM进行奖励模型蒸馏

计算与语言 2026-01-21 v1

摘要

奖励模型(RMs)在将大型语言模型(LLMs)与人类偏好相匹配方面发挥着关键作用。由于获取高质量的人类偏好标注困难, 从生成式LLM蒸馏偏好已成为标准做法。然而,现有方法主要将教师模型视为简单的二进制标注者,未能充分利用教师LLM的丰富知识和能力进行RM蒸馏。为此,我们提出RM-Distiller,一个旨在系统性地利用教师LLM多维能力的框架:(1) 精炼能力,可合成高度相关的响应对,以创建细粒度且具对比性的信号;(2) 评分能力,可通过基于边际的优化目标指导RM捕获精确的偏好强度;(3) 生成能力,可将教师的生成分布纳入正则化,使RM保留其基本语言知识。大量实验表明,RM-Distiller在RM基准测试和基于强化学习的对齐方面均显著优于传统蒸馏方法,证明充分利用多维教师能力对有效的奖励建模至关重要。据我们了解,这是首个系统性地研究从生成式LLM进行RM蒸馏的工作。

关键词

引用

@article{arxiv.2601.14032,
  title  = {RM-Distiller: Exploiting Generative LLM for Reward Model Distillation},
  author = {Hongli Zhou and Hui Huang and Wei Liu and Chenglong Wang and Xingyuan Bu and Lvyuan Han and Fuhai Song and Muyun Yang and Wenhao Jiang and Hailong Cao and Tiejun Zhao},
  journal= {arXiv preprint arXiv:2601.14032},
  year   = {2026}
}