中文

HelpSteer2:用于训练顶级奖励模型的开源数据集

计算与语言 2024-06-14 v1 人工智能 机器学习

摘要

高质量的偏好数据集对于训练能够有效引导大型语言模型(LLMs)生成符合人类偏好的高质量响应的奖励模型至关重要。随着 LLMs 不断变得更强大且更好的对齐,诸如 Open Assistant、HH-RLHF 和 HelpSteer 等许可证宽松的偏好数据集需要不断更新才能保持其对奖励建模的有效性。从专有 LLM 如 GPT-4 提取偏好数据的技术受限于商业使用限制。为提高生成响应和属性标记质量,我们发布 HelpSteer2,一个采用 CC-BY-4.0 许可证的偏好数据集。使用基于 HelpSteer2 训练的强大内部基础模型,我们能够在 Reward-Bench 主要数据集上取得 SOTA 分数(92.0%),超越目前列出的开源和专有模型,截至 2024 年 6 月 12 日。值得注意的是,HelpSteer2 仅包含一万对响应,数量比现有偏好数据集(如 HH-RLHF)少一个数量级,这使得其在训练奖励模型方面具有高度效率。我们的广泛实验表明,使用 HelpSteer2 训练的奖励模型在对齐 LLMs 方面效果显著。特别是,我们提出了 SteerLM 2.0,这是一种能够有效利用我们奖励模型预测的丰富多属性得分的模型对齐方法。HelpSteer2 可在 https://huggingface.co/datasets/nvidia/HelpSteer2 获得,代码可在 https://github.com/NVIDIA/NeMo-Aligner 获取。

关键词

引用

@article{arxiv.2406.08673,
  title  = {HelpSteer2: Open-source dataset for training top-performing reward models},
  author = {Zhilin Wang and Yi Dong and Olivier Delalleau and Jiaqi Zeng and Gerald Shen and Daniel Egert and Jimmy J. Zhang and Makesh Narsimhan Sreedhar and Oleksii Kuchaiev},
  journal= {arXiv preprint arXiv:2406.08673},
  year   = {2024}
}