中文

文本分段与奖励学习:改进语言模型中的 RLHF

计算与语言 2025-01-07 v1 人工智能

摘要

基于人类反馈的强化学习(RLHF)已被广泛用于使语言模型(LMs)与人类偏好对齐。已有的 RLHF 工作通常采用赌博机(bandit)建模方式,虽然直观,但忽略了语言模型生成的序列特性,并面临奖励稀疏的问题。虽然近期工作提出了密集的 token 级 RLHF,但将每个 token 视为动作可能过于精细,难以进行恰当的奖励分配。本文旨在兼顾二者之所长,训练并利用一个段级奖励模型,为每个跨越较短 token 序列的语义完整文本段分配奖励。在奖励学习方面,我们的方法支持动态文本分段,并兼容标准的序列偏好数据集。为了在段奖励下进行有效的基于强化学习的语言模型训练,我们将经典的标量赌博机奖励归一化方法推广为位置感知的归一化函数,并对段奖励进行插值以进一步密集化。凭借上述设计,我们的方法在三个主流的语言模型策略 RLHF 基准(AlpacaEval 2.0、Arena-Hard 和 MT-Bench)上取得了具有竞争力的表现。我们还进行了消融研究以进一步验证方法的有效性。

关键词

引用

@article{arxiv.2501.02790,
  title  = {Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model},
  author = {Yueqin Yin and Shentao Yang and Yujia Xie and Ziyi Yang and Yuting Sun and Hany Awadalla and Weizhu Chen and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2501.02790},
  year   = {2025}
}