AdaJudge:用于奖励建模的自适应多视角判断
计算与语言
2026-01-14 v1 机器学习
摘要
奖励建模是将大型语言模型与人类偏好对齐的关键步骤,但主流架构依赖静态池化策略将序列压缩为标量得分。这种范式存在两个关键局限性:静态归纳偏差与任务相关偏好信号不匹配,以及背板优化用于生成而非细粒度判别的表征不匹配。为此,我们提出 AdaJudge,一个统一框架,联合适应表征和聚合。AdaJudge 首先通过门控细化块将背板表征细化为判别导向的空间,然后用自适应多视图池化模块取代静态读出,动态路由和组合证据。在 RM-Bench 和 JudgeBench 上的大量实验表明,AdaJudge 在强大的即插即用奖励模型和传统池化基线方面均表现优异。
引用
@article{arxiv.2601.08097,
title = {AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling},
author = {Yongliang Miao and Yangyang Liang and Mengnan Du},
journal= {arXiv preprint arXiv:2601.08097},
year = {2026}
}