Skywork-Reward:用于LLM奖励建模的技巧合集
人工智能
2024-10-25 v1 计算与语言
摘要
本报告介绍了一系列用于增强LLM奖励建模的方法,特别聚焦于数据中心技术。我们提出了有效的数据选择与过滤策略,用于构建高质量的开源偏好数据集,最终形成Skywork-Reward数据集合,仅包含8万条偏好对——显著小于现有数据集的规模。借助该精选数据集,我们开发了Skywork-Reward模型系列——Skywork-Reward-Gemma-27B和Skywork-Reward-Llama-3.1-8B,其中前者目前在RewardBench排行榜中位居第一。值得注意的是,我们的技术与数据集直接提升了RewardBench上众多顶尖模型的性能,凸显了这些贡献在实际偏好学习应用中的实际影响。
关键词
引用
@article{arxiv.2410.18451,
title = {Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs},
author = {Chris Yuhao Liu and Liang Zeng and Jiacai Liu and Rui Yan and Jujie He and Chaojie Wang and Shuicheng Yan and Yang Liu and Yahui Zhou},
journal= {arXiv preprint arXiv:2410.18451},
year = {2024}
}