中文

面向语言模型的弱监督奖励建模

计算与语言 2024-10-29 v1

摘要

大型语言模型(LLMs)的最新进展使其在各种任务中的应用日益广泛,其中基于人类反馈的强化学习(RLHF)是其训练的关键部分,旨在使模型的回复与用户意图对齐。在 RLHF 过程中,使用由人类标注员或 AI 系统确定的回复偏好来训练奖励模型,随后通过强化学习对 LLM 进行微调。本工作引入弱监督作为一种策略,以扩展 RLHF 数据集并提升奖励模型性能。弱监督采用带噪或不精确的数据标注,减少了对昂贵人工标注数据的依赖。通过分析 RLHF 数据集以识别与回复偏好相关的启发式规则,我们编写了简单的标注函数,随后校准了一个标注模型以对未标注数据进行弱标注。我们的评估表明,尽管弱监督通过提升奖励模型性能显著惠及较小的数据集,但其在较大且已有原始标注的数据集上的有效性会降低。此外,使用 LLM 生成并随后弱标注回复,为扩展偏好数据提供了一种极具前景的方法。

关键词

引用

@article{arxiv.2410.20869,
  title  = {Reward Modeling with Weak Supervision for Language Models},
  author = {Ben Hauptvogel and Malte Ostendorff and Georg Rehm and Sebastian Möller},
  journal= {arXiv preprint arXiv:2410.20869},
  year   = {2024}
}