中文

以用户为中心的主观型排行榜:通过可定制的奖励建模

计算与语言 2025-08-14 v1

摘要

现有的大型语言模型(LLM)基准测试主要侧重通过可验证任务来评估其能力。这种客观且静态的基准测试对于实际的LLM选择有限,使得用户难以找到符合其个人需求的合适模型。为弥合这一差距,我们提出首个以用户为中心的主观型排行榜(USL),该排行榜提供了基于偏好的、动态的LLM排名,覆盖多样化的真实场景。我们的工作基于对真实人类偏好数据的深入调查,涉及超过1万个主观查询。我们的调查发现,人类偏好在多样性和矛盾性方面存在显著差异,这限制了当前最先进奖励模型的有效性。为此,我们引入了可定制奖励模型(CRM)。仅需4B参数的CRM便超越了GPT-4.1和Gemini-2.5-pro等领先模型,展现出在新主题和新标准下的卓越泛化能力。受CRM驱动的USL与矛盾偏好呈现强烈的负相关。

关键词

引用

@article{arxiv.2508.09463,
  title  = {User-centric Subjective Leaderboard by Customizable Reward Modeling},
  author = {Qi Jia and Xiujie Song and Zicheng Zhang and Yijin Guo and Kaiwei Zhang and Zijian Chen and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2508.09463},
  year   = {2025}
}