Cheems:从零构建与评估中文奖励模型的实用指南
计算与语言
2025-05-27 v3 人工智能
摘要
奖励模型对于将大语言模型与人类偏好对齐至关重要。然而,大多数奖励模型研究以英语为中心,并严重依赖合成资源,这导致中文的数据集和基准有限且可靠性不足。为弥补这一空白,我们引入了 CheemsBench,一个在中文语境下完全由人工标注的奖励模型评估基准,以及 CheemsPreference,一个通过人机协作标注的大规模、多样化偏好数据集,以支持中文奖励模型训练。我们在 CheemsBench 上系统评估了开源的判别式与生成式奖励模型,并观察到它们在捕捉中文场景下人类偏好方面存在显著局限。此外,基于 CheemsPreference,我们构建了一个在 CheemsBench 上达到 SOTA 性能的奖励模型,证明了奖励模型训练中人类监督的必要性。我们的发现表明,规模化的 AI 生成数据难以完全捕捉人类偏好,强调了奖励模型开发中高质量人类监督的重要性。
引用
@article{arxiv.2502.17173,
title = {Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch},
author = {Xueru Wen and Jie Lou and Zichao Li and Yaojie Lu and Xing Yu and Yuqiu Ji and Guohai Xu and Hongyu Lin and Ben He and Xianpei Han and Le Sun and Debing Zhang},
journal= {arXiv preprint arXiv:2502.17173},
year = {2025}
}
备注
Accepted to ACL 2025