中文

RubricEval:面向指令遵循的 LLM 评估器的评分量表级元评估基准测试

人工智能 2026-03-27 v1

摘要

基于评分量表的评估已成为评估大语言模型(LLM)指令遵循能力的主流范式。尽管其应用广泛,但这些评分量表级评估的可靠性仍不明确,亟需元评估。然而,先前的元评估工作主要聚焦于响应层面,未能评估评分量表级评估所依赖的细粒度判断准确性。为弥补这一空白,我们提出了 RubricEval。我们的基准测试具有以下特点:(1)首个面向指令遵循的评分量表级元评估基准测试;(2)涵盖多个类别和模型来源的多样化指令与响应;(3)共计 3,486 个经过质量控制的实例,以及能更好区分评估器性能的 Easy/Hard 子集。我们的实验揭示,评分量表级判断远未解决:即使 GPT-4o——指令遵循基准测试中广泛使用的评估器——在 Hard 子集上也仅达到 55.97%。从评估范式来看,评分量表级评估优于清单级评估,显式推理能提升准确性,两者结合可降低评估者间方差。通过我们建立的评分量表分类体系,我们进一步识别了常见失败模式,并为可靠的指令遵循评估提供了可操作的见解。

关键词

引用

@article{arxiv.2603.25133,
  title  = {RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following},
  author = {Tianjun Pan and Xuan Lin and Wenyan Yang and Qianyu He and Shisong Chen and Licai Qi and Wanqing Xu and Hongwei Feng and Bo Xu and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2603.25133},
  year   = {2026}
}

备注

9 pages, 5 figures