HelpSteer2-偏好数据:辅助评分的偏好补充
摘要
奖励模型是对齐模型以遵循指令至关重要的手段,通常遵循两大流行范式进行训练:布拉德-蒂里式或回归式。然而,目前缺乏充分匹配数据后,比较两种方法优劣的证据。这主要源于这两种方法需要以不同(但不兼容)格式收集数据,导致现有公开数据集中无法获得足够匹配的数据。为解决此问题,我们向HelpSteer2数据集补充偏好标注(用于布拉德-蒂里式训练),以补充原本用于回归式训练的评分数据。为提高数据可解释性,偏好标注附带了人工撰写的依据。利用这一数据,我们进行首次在数据充分匹配条件下对布拉德-蒂里模型与回归模型的头盾比较。基于此类比较所得的洞见,我们提出一种新颖的组合方法,将布拉德-蒂里与回归奖励建模相结合。一个基于Llama-3.1-70B-Instruct模型,采用该方法微调后在RewardBench上得分94.1,位列超过140个奖励模型的前列(截至2024年10月1日)。该奖励模型可用于REINFORCE算法(RLHF),对齐一个Instruct模型达到Arena Hard上的85.0分,位列2024年10月1日榜单第1名。我们以CC-BY-4.0许可证开源该数据集,地址为https://huggingface.co/datasets/nvidia/HelpSteer2#preferences-new -- 2024年10月1日。同时,我们公开发布训练好的奖励模型与Instruct模型,地址分别为https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward和https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct
引用
@article{arxiv.2410.01257,
title = {HelpSteer2-Preference: Complementing Ratings with Preferences},
author = {Zhilin Wang and Alexander Bukharin and Olivier Delalleau and Daniel Egert and Gerald Shen and Jiaqi Zeng and Oleksii Kuchaiev and Yi Dong},
journal= {arXiv preprint arXiv:2410.01257},
year = {2025}
}
备注
Accepted to ICLR 2025; 28 pages, 3 figures