LLM作为评审团:跨模型共识在LLM推理中可优于过程奖励模型
机器学习
2026-07-11 v1 人工智能
摘要
从一组候选推理链中选择正确答案是测试时扩展的引擎,然而标准选择器各有代价:自洽性继承了其重采样的单一模型的错误,而训练好的奖励模型需要标注数据且在分布外迁移性差。我们研究第三种信号,在推理时免费获得:跨模型共识,即独立训练的模型各自解决问题一次,对最终答案的一致程度。我们将该小组视为一个LLM评审团,其中一致性的结构,而非任何模型对另一个模型的评分,是验证信号。在七个基准测试中,它比自洽性更好地选择正确答案,并且远优于模型自我评分其候选答案:在竞赛数学上,它完全缩小了与预言机选择器的差距,而自我评分几乎没有任何改善。其机制是错误去相关:独立训练的模型错误方式不同,因此它们的错误答案分散,而正确答案则积累一致性。我们用一个无参数定律使其精确化,该定律以闭式推导,可从三个测量的面板统计量预测一致性准确率,平均绝对误差为0.03,并揭示了该方法的极限:一个共享错误下限,即模型共享误解,在数学上接近零,但在科学上不可忽视。与四个跨越判别式、结果式和生成式奖励模型的训练验证器相比,免费的LLM评审团在其数学训练领域内匹配最强的验证器,并且在其外部是首选选择器。因此,跨模型共识是一个我们可以预先表征的验证器:一个说明何时信任它的定律,以及一个标记其不能工作之处的地板。
引用
@article{arxiv.2607.10139,
title = {LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning},
author = {Ning Liu},
journal= {arXiv preprint arXiv:2607.10139},
year = {2026}
}