中文

Skywork-Reward-V2:通过人类-人工协同扩展偏好数据 curated

计算与语言 2026-03-04 v3 人工智能 机器学习

摘要

尽管奖励模型 (RM) 在强化学习人类反馈 (RLHF) 中发挥着至关重要的作用,但当前最先进的开源RM在大多数现有评估基准测试中表现不佳,难以捕捉人类偏好细微差别。我们假设,这种脆弱性主要源于偏好数据集的局限性,这些数据集往往范围狭窄、人工标签化,或缺乏严格的质量控制。为此,我们提出了规模为4000万偏好对的SynPref-40M数据集。为实现大规模数据 curated,我们设计了一种人类-人工协同两阶段流程,利用人类标注质量和AI可扩展性的互补优势。在此流程中,人类提供验证后的标注,而LLM则基于人类指导进行自动化数据 curated。训练此偏好混合数据后,我们引入Skywork-Reward-V2,一套参数规模从0.6B到8B的八个奖励模型,这些模型在SynPref-40M中精心挑选的2600万偏好对上进行训练。我们展示,Skywork-Reward-V2在广泛的能力范围内都表现出色,包括与人类偏好的对齐、客观正确性、安全性、抗风格偏见能力以及最佳N scaling。这些奖励模型在七大奖励模型基准测试中实现了最先进的性能,超越生成式奖励模型,并在下游任务中表现出色。消融研究确认,效果不仅来自数据规模,还来自高质量的 curated。Skywork-Reward-V2系列在开源奖励模型领域取得了重要进展,展示了人类-人工协同如何实现显著更高的数据质量。

关键词

引用

@article{arxiv.2507.01352,
  title  = {Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy},
  author = {Chris Yuhao Liu and Liang Zeng and Yuzhen Xiao and Jujie He and Jiacai Liu and Chaojie Wang and Rui Yan and Wei Shen and Fuxiang Zhang and Jiacheng Xu and Yang Liu and Yahui Zhou},
  journal= {arXiv preprint arXiv:2507.01352},
  year   = {2026}
}

备注

ICLR 2026 Poster