HelpSteer3-Preference:跨任务与语言的开放人类标注偏好数据
计算与语言
2025-10-27 v2 人工智能
机器学习
摘要
偏好数据集是训练通用领域、遵循指令语言模型的强化学习人类反馈(RLHF)的关键。每一次后续数据发布都提升了未来数据收集的期望值,这意味着不断需要推动开放可获取偏好数据的质量和多样性。为此,我们介绍HelpSteer3-Preference,一个采用CC-BY-4.0许可证的高质量、人类标注偏好数据集,包含超过40,000个样本。这些样本涵盖大型语言模型(LLM)的多种实际应用场景,包括STEM、编码和多语言场景。使用HelpSteer3-Preference,我们训练的奖励模型(RM)在RM-Bench(82.4%)和JudgeBench(73.7%)上取得顶级成绩。这代表着与现有奖励模型相比显著提升(约10%绝对值)。我们进一步展示HelpSteer3-Preference还可用于训练生成式奖励模型,以及如何使用我们的奖励模型进行RLHF对齐策略模型。数据集(CC-BY-4.0):https://huggingface.co/datasets/nvidia/HelpSteer3#preference 模型(NVIDIA开放模型):https://huggingface.co/collections/nvidia/reward-models-68377c5955575f71fcc7a2a3
引用
@article{arxiv.2505.11475,
title = {HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages},
author = {Zhilin Wang and Jiaqi Zeng and Olivier Delalleau and Hoo-Chang Shin and Felipe Soares and Alexander Bukharin and Ellie Evans and Yi Dong and Oleksii Kuchaiev},
journal= {arXiv preprint arXiv:2505.11475},
year = {2025}
}
备注
NeurIPS 2025 Datasets and Benchmarks Track Camera Ready, 46 pages, 2 figures