基于迭代自训练的半监督奖励建模
机器学习
2024-09-12 v1
摘要
奖励模型(RM)捕捉人类的价值观和偏好,是强化学习与人类反馈(RLHF)中预训练大语言模型(LLM)对齐的核心组件。传统方法依赖大量的人工标注偏好数据,在可扩展性和成本方面存在显著挑战。为克服这一限制,我们提出半监督奖励建模(SSRM)方法,通过利用未标注数据来增强RM的训练。给定未标注数据集,SSRM涉及三个关键的迭代步骤:对未标注样本进行伪标签化、通过置信阈值筛选高置信度样本、以及在精炼后的数据集上进行监督微调。通过在各种模型配置下的大量实验,我们展示了SSRM在不增加标注成本的情况下显著提升奖励模型的性能。尤其值得注意的是,SSRM能够实现与完全在等量标注数据volume上训练的模型持相当的性能。总体而言,SSRM大幅减少了对大量人工标注数据的依赖,从而降低了训练高质量奖励模型的总体成本和时间。
引用
@article{arxiv.2409.06903,
title = {Semi-Supervised Reward Modeling via Iterative Self-Training},
author = {Yifei He and Haoxiang Wang and Ziyan Jiang and Alexandros Papangelis and Han Zhao},
journal= {arXiv preprint arXiv:2409.06903},
year = {2024}
}