通过同行评审流程为大型语言模型打分、推理与选择最佳
计算与语言
2026-04-28 v3 人工智能
摘要
我们提出 LLM-PeerReview,一种无监督 LLM 集成方法,从多个 LLM 生成的候选答案中选择每个查询的最佳响应,充分利用来自不同强项的多个模型的智慧。LLM-PeerReview 建立在新颖的同行评审启发框架之上,提供透明且可解释的机制,同时保持完全无监督以实现灵活的适应性和通用性。具体而言,它包含三个阶段:对于评分,我们使用新兴的 LLM-as-a-Judge 技术通过重复使用手头的多个 LLM 来评估每个响应;对于推理,我们可以应用简单的平均策略或基于图形模型的原理性真理推断算法来聚合多个评分,为每个响应产生最终评分;最后,选择最高评分的响应作为最佳集成输出。LLM-PeerReview 概念简单且实证强大。我们在四个数据集上进行实验,表明本文提出的方法的两个变体分别比先进模型 Smoothie-Global 提高 6.9% 和 7.3%,跨越事实回忆 QA、数学推理和指令遵循等不同任务类型。
引用
@article{arxiv.2512.23213,
title = {Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process},
author = {Zhijun Chen and Zeyu Ji and Qianren Mao and Hao Wu and Jinhuan Song and Junhang Cheng and Bangjie Qin and Zhuoran Li and Jingzheng Li and Kai Sun and Zizhe Wang and Yikun Ban and Zhu Sun and Xiangyang Ji and Hailong Sun},
journal= {arXiv preprint arXiv:2512.23213},
year = {2026}
}