DMoERM:用于有效奖励建模的混合专家方案
计算与语言
2024-04-30 v2
摘要
奖励模型(RM)的性能是提升对齐微调中大型语言模型(LLM)有效性的关键因素。RM训练中仍存在两个挑战:1)使用各类数据训练同一RM可能导致其泛化性能受到多任务干扰的影响;2)人类标注一致性率通常仅为至,导致训练数据包含大量噪声。为应对这两个挑战,我们首次将混合专家(MoE)的思想引入RM领域。我们提出了双层MoE RM(DMoERM)。外层MoE是一个稀疏模型。在将输入分类为任务类别后,我们将其路由到相应的内层任务特定模型。内层MoE是一个稠密模型。我们将特定任务分解为多个能力维度,并在每个维度上分别微调一个LoRA专家。它们的输出随后通过MLP进行合成以计算最终奖励。为最小化成本,我们调用公共LLM API以获取能力偏好标签。在人工标注数据集上的验证证实,我们的模型获得了与人类偏好高度的一致性,并超越了先进的生成式方法。同时,通过BoN采样和RL实验,我们证明了我们的模型优于最先进的RM集成方法,并缓解了过度优化问题。我们的代码和数据集可在以下地址获取:https://github.com/quanshr/DMoERM-v1。
引用
@article{arxiv.2403.01197,
title = {DMoERM: Recipes of Mixture-of-Experts for Effective Reward Modeling},
author = {Shanghaoran Quan},
journal= {arXiv preprint arXiv:2403.01197},
year = {2024}
}
备注
23 pages, 8 figures