中文

Skywork-Reward:用于LLM奖励建模的技巧合集

人工智能 2024-10-25 v1 计算与语言

摘要

本报告介绍了一系列用于增强LLM奖励建模的方法,特别聚焦于数据中心技术。我们提出了有效的数据选择与过滤策略,用于构建高质量的开源偏好数据集,最终形成Skywork-Reward数据集合,仅包含8万条偏好对——显著小于现有数据集的规模。借助该精选数据集,我们开发了Skywork-Reward模型系列——Skywork-Reward-Gemma-27B和Skywork-Reward-Llama-3.1-8B,其中前者目前在RewardBench排行榜中位居第一。值得注意的是,我们的技术与数据集直接提升了RewardBench上众多顶尖模型的性能,凸显了这些贡献在实际偏好学习应用中的实际影响。

关键词

引用

@article{arxiv.2410.18451,
  title  = {Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs},
  author = {Chris Yuhao Liu and Liang Zeng and Jiacai Liu and Rui Yan and Jujie He and Chaojie Wang and Shuicheng Yan and Yang Liu and Yahui Zhou},
  journal= {arXiv preprint arXiv:2410.18451},
  year   = {2024}
}