中文

结构化奖励模型:提升奖励建模中可解释性、效率与可扩展性

人工智能 2025-10-07 v2

摘要

奖励模型(RM)是评估和引导语言模型输出的关键组件。然而,传统标量RM在推理过程中往往难以融合上下文和背景信息,导致评估不完整。生成式奖励模型(GRM)试图通过生成中间推理步骤来解决这些限制。然而,其受控的黑箱性质以及由于顺序解码导致的低效,阻碍了其在工业领域的部署。工业场景(如搜索和推荐系统)常涉及单领域任务,需要沿特定维度进行评估。在此情境下,对“差异案例”的诊断需要结构化反馈以识别和优化特定维度的问题。本文提出了结构化奖励模型(SRM),一种模块化且可解释的框架,集成旁分支模型作为辅助特征生成器。通过引入细粒度维度,SRM实现可解释且高效的评估,促进针对性诊断和优化。这种结构化方法确保了工业应用的适应性和可扩展性。通过综合实验,我们展示SRM在鲁棒性和与人类偏好的一致性方面优于标量RM和GRM。模块化设计进一步支持针对实际场景的高效优化,使SRM能够为工业界提供实用的奖励建模解决方案。

关键词

引用

@article{arxiv.2509.25361,
  title  = {Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling},
  author = {Xiaoyu Liu and Di Liang and Chang Dai and Hongyu Shan and Peiyang Liu and Yonghao Liu and Muling Wu and Yuntao Li and Xianjie Wu and LI Miao and Jiangrong Shen and Minlong Peng},
  journal= {arXiv preprint arXiv:2509.25361},
  year   = {2025}
}