中文

BERT 作为评判器:高效参考基准 LLM 评估的稳健替代方案

计算与语言 2026-04-13 v1 人工智能

摘要

准确评估是大型语言模型(LLM)生态系统的核心,指导模型选择及其在多样化应用场景中的下游部署。然而,实际评估生成输出通常依赖刚性词汇方法来提取和评估答案,这会混淆模型的真实问题解决能力与其对预定义格式规范的遵从程度。虽然近期的 LLM-作为-评判器方法通过评估语义正确性而非严格结构一致性来缓解此问题,但也引入了 substantial 计算开销,使评估成本高昂。本文首先通过一个规模庞大的实证研究(涵盖 36 个模型和 15 个下游任务),系统检视词汇评估的局限性,表明此类方法与人类判断关联性较差。为此,我们引入 BERT-作为-评判器,这是一种基于编码器的用于评估参考基准生成式场景下答案正确性的方法,能鲁棒地处理输出措辞的变体,且仅需对合成标注的问句-候选-参考三元组进行轻量级训练。我们展示,它在持续优于词汇基准的同时,还能匹配规模更大的 LLM 评判器的性能,在两者之间提供了引人注目的权衡,实现可靠且可扩展的评估。最终,通过大量实验,我们为 BERT-作为-评判器的性能提供了详细洞察,为实践者提供实用指导,并发布所有项目构件以促进后续应用。

关键词

引用

@article{arxiv.2604.09497,
  title  = {BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation},
  author = {Hippolyte Gisserot-Boukhlef and Nicolas Boizard and Emmanuel Malherbe and Céline Hudelot and Pierre Colombo},
  journal= {arXiv preprint arXiv:2604.09497},
  year   = {2026}
}