中文

HAF-RM:一种用于奖励模型训练的混合对齐框架

计算机视觉与模式识别 2024-07-08 v1

摘要

奖励模型在大语言模型 (LLM) 的对齐、评估和数据构建方面日益重要。目前大多数研究者致力于通过数据改进来增强奖励模型,遵循针对奖励模型的常规训练框架,直接优化预测的奖励值。本文提出了一种混合对齐框架 HaF-RM,用于奖励模型训练,通过在词汇级别的策略概率上引入额外约束。该框架能够在词汇级别同步监督内部偏好模型,同时在序列级别优化奖励模型的映射层。实验结果在五个数据集上充分表明,我们提出的混合框架用于训练高质量奖励模型的有效性。通过解耦奖励建模过程并融合混合监督,我们的 HaF-RM 框架提供了一种原则且有效的方法,用于提升奖励模型的性能和对齐性,这是负责任地开发强大语言模型的关键组件。我们在 https://haf-rm.github.io 发布代码。

关键词

引用

@article{arxiv.2407.04184,
  title  = {QueryMamba: A Mamba-Based Encoder-Decoder Architecture with a Statistical Verb-Noun Interaction Module for Video Action Forecasting @ Ego4D Long-Term Action Anticipation Challenge 2024},
  author = {Zeyun Zhong and Manuel Martin and Frederik Diederichs and Juergen Beyerer},
  journal= {arXiv preprint arXiv:2407.04184},
  year   = {2024}
}