中文

中等性是 LLM 作为评判锚点选择的关键

计算与语言 2026-03-18 v1

摘要

“LLM 作为评判官” (LLM-as-a-judge) 范式已成为评估开放式生成的标准方法。为解决两两比较的二次规模成本,诸如 Arena-Hard 和 AlpacaEval 等流行基准会比较所有模型针对单个锚点。然而,尽管该方法广泛使用,但锚点选择对结果可靠性的影响仍鲜有探讨。本文通过在 Arena-Hard-v2.0 数据集上评估 22 种不同的锚点,系统性地研究了锚点选择的影响。我们发现锚点的选择至关重要:差励的锚点会显著降低与人类排名的相关性。我们指出,常见的锚点选择(表现最好的模型和最差的模型)是差励的锚点。由于这些极端锚点始终优于或劣于所有其他模型,它们很少能反映模型之间的相对排名。我们进一步量化了锚点选择的效应大小,发现其影响规模相当于评判官模型的选择。我们以可操作性建议收尾。首先,我们进行了功效分析,计算了锚点基准评估的充分样本量,发现标准基准规模对两两评估不够,无法可靠区分竞争性模型。其次,我们提供了选择有信息量锚点的指南,以确保可靠且高效的评估实践。

关键词

引用

@article{arxiv.2603.16848,
  title  = {Mediocrity is the key for LLM as a Judge Anchor Selection},
  author = {Shachar Don-Yehiya and Asaf Yehudai and Leshem Choshen and Omri Abend},
  journal= {arXiv preprint arXiv:2603.16848},
  year   = {2026}
}