中文

WildReward:来自野生人类互动的奖励模型学习

计算与语言 2026-02-10 v1 人工智能

摘要

奖励模型(RM)是大型语言模型(LLM)训练的关键,但它们通常依赖大规模的人工标注偏好对。随着 LLM 的广泛部署,野生互动已成为丰富的隐式奖励信号来源。这引出了一个问题:我们能否直接从野生互动中开发奖励模型?本工作通过采用 WildChat 作为互动来源,提出从中提取可靠人类反馈的管道,构建 18.6k 条高质量实例,用于通过序数回归直接在用户反馈上训练 WildReward,而无需偏好对。广泛实验表明,WildReward 在各类任务上实现与常规奖励模型相当甚至更好的性能,同时改善校准和跨样本一致性。我们还观察到,WildReward 直接受益于用户多样性,其中更多用户可导致更强大的奖励模型。最后,我们将 WildReward 应用于在线 DPO 训练,观察到在各种任务中实现显著改进。代码和数据已发布于 https://github.com/THU-KEG/WildReward。

关键词

引用

@article{arxiv.2602.08829,
  title  = {WildReward: Learning Reward Models from In-the-Wild Human Interactions},
  author = {Hao Peng and Yunjia Qi and Xiaozhi Wang and Zijun Yao and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2602.08829},
  year   = {2026}
}