中文

超越共识幻象:从表面启发式到知识 grounding 评估中的 LLM-as-a-judge

计算与语言 2026-03-12 v1

摘要

LLM-as-a-judge 范式依赖一个关键假设,即高的评估者间一致性表明可靠且客观的评估。我们提出两个互补发现,挑战了这一假设。首先,我们展示了这种共识常常是幻觉的。我们识别并形式化了“评估幻象”,即 LLM 评估者生成精细的批评性意见却以共享的表面启发式为基础,而非基于实质性的质量。通过对 105,600 个评估实例(32 个 LLM × 3 个前沿评估者 × 100 个任务 × 11 个温度)的大规模研究,我们显示模型层面的一致性(Spearman ρ=0.99\rho = 0.99)掩盖了样本层面的脆弱一致性(Pearson rˉ=0.72\bar{r} = 0.72;绝对一致性 ICC =0.67= 0.67),仅共享 rubric 结构恢复了 62% 的总体一致性,高质量输出反而获得最不一致的评估。其次,我们展示了动态生成基于领域知识的评估 rubric 能产生更有意义的评估。我们引入了 MERG(Metacognitive Enhanced Rubric Generation),一种基于知识的 rubric 生成框架,其领域选择性效应确认了这一点。在编码化领域(教育 +22%,学术 +27%)中,一致性提升,在主观领域中,一致性下降,这反映出真实的评估多样性。这些发现表明,评估 rubric 应当动态地通过专家知识丰富化,而不是依赖通用标准,这对 RLAIF 中的奖励建模具有深远含义。

关键词

引用

@article{arxiv.2603.11027,
  title  = {Beyond the Illusion of Consensus: From Surface Heuristics to Knowledge-Grounded Evaluation in LLM-as-a-Judge},
  author = {Mingyang Song and Mao Zheng and Chenning Xu},
  journal= {arXiv preprint arXiv:2603.11027},
  year   = {2026}
}