中文

AdaJudge:用于奖励建模的自适应多视角判断

计算与语言 2026-01-14 v1 机器学习

摘要

奖励建模是将大型语言模型与人类偏好对齐的关键步骤,但主流架构依赖静态池化策略将序列压缩为标量得分。这种范式存在两个关键局限性:静态归纳偏差与任务相关偏好信号不匹配,以及背板优化用于生成而非细粒度判别的表征不匹配。为此,我们提出 AdaJudge,一个统一框架,联合适应表征和聚合。AdaJudge 首先通过门控细化块将背板表征细化为判别导向的空间,然后用自适应多视图池化模块取代静态读出,动态路由和组合证据。在 RM-Bench 和 JudgeBench 上的大量实验表明,AdaJudge 在强大的即插即用奖励模型和传统池化基线方面均表现优异。

关键词

引用

@article{arxiv.2601.08097,
  title  = {AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling},
  author = {Yongliang Miao and Yangyang Liang and Mengnan Du},
  journal= {arXiv preprint arXiv:2601.08097},
  year   = {2026}
}