JudgeBoard:小型语言模型推理评估的基准测试与提升
人工智能
2025-11-21 v1 计算与语言
摘要
虽然小型语言模型(SLMs)在各种推理任务上显示出前景,但其相较于大型语言模型(LLMs)的答案判断能力尚不明了。以往的 LLM 作为评判者框架通常依赖于通过预定义指标(如蕴涵)将候选答案与真实标签或其他候选答案进行比较。然而,这种方法本质上是间接的且难以完全自动化,难以支持对推理输出的细粒度和可扩展评估。在本工作中,我们提出 JudgeBoard,一种直接查询模型以评估候选答案正确性的新型评估管道,无需额外答案比较。我们聚焦于数学推理和科学/常识推理两个核心推理领域,基于准确率排序和基于 Elo 评分系统构建了五个基准数据集上的任务特定评估排行榜,实现了作为评判者而非比较者的模型间的一致性比较。为提升轻量级模型的判断性能,我们提出 MAJ(多智能体判断),一种新型多智能体评估框架,利用具有不同推理轮廓的多个交互 SLMs,通过协合 deliberation 来模拟 LLM 级别的判断精度。实验结果显示,SLMs 与 LLMs 在孤立判断任务中存在显著性能差距。然而,我们的 MAJ 框架显著提升了 SLMs 的可靠性和一致性。在 MATH 数据集上,MAJ 使用较小规模模型作为底层模型的表现,甚至优于较大规模模型。我们的发现表明,多智能体 SLM 系统可能在判断任务中匹配甚至超越 LLM performance,对可扩展且高效评估具有深远意义。
引用
@article{arxiv.2511.15958,
title = {JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation},
author = {Zhenyu Bi and Gaurav Srivastava and Yang Li and Meng Lu and Swastik Roy and Morteza Ziyadi and Xuan Wang},
journal= {arXiv preprint arXiv:2511.15958},
year = {2025}
}
备注
23 pages, 4 figures