中文

通过反向推断构建小型奖励模型

计算与语言 2026-02-26 v2

摘要

奖励模型(Reward Models, RMs)在语言模型(LM)管道中发挥着核心作用,尤其是在不可验证的领域。然而,主导性的大模型作为裁判(LLM-as-a-Judge)范式依赖于大型模型的强大推理能力,而另一些方法则需要参考响应或明确的评分标准,这限制了其灵活性和更广泛的可访问性。本文提出了 FLIP(FLipped Inference for Prompt reconstruction,翻转推断用于提示重建),一种无需参考响应且无需评分标准的奖励建模方法,通过反向推断来实现:推断最可能产生给定响应的指令。推断得到的指令与原始指令之间的相似性即用作奖励信号。在使用 13 个小型语言模型进行的四个领域上的评估表明,FLIP 在 LLM-as-a-Judge 基线上平均提高了 79.6%。此外,FLIP 在通过并行抽样和 GRPO 训练进行的测试时扩展评估中显著提升了下游性能。我们进一步发现,FLIP 对较长输出特别有效,并且对常见的奖励攻击具有鲁棒性。通过显式地利用验证-生成之间的差距,FLIP 在规模受限的场景中实现可靠的奖励建模,而这些场景中传统的判决方法会失败。代码已公开于 https://github.com/yikee/FLIP。

关键词

引用

@article{arxiv.2602.13551,
  title  = {Small Reward Models via Backward Inference},
  author = {Yike Wang and Faeze Brahman and Shangbin Feng and Teng Xiao and Hannaneh Hajishirzi and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2602.13551},
  year   = {2026}
}