中文

评测指纹:LLM 评测器行为的稳定系统性差异

人工智能 2026-01-09 v1

摘要

LLM-as-judge 系统有望实现可扩展、一致的评测。我们发现了相反的情况:评测器自身是一致的,但彼此之间并不一致;它们各自保持自洽。在 3,240 次评测(9 个评测器 × 120 个独立视频 × pack 项 × 3 次独立运行)中,评测器间的一致性接近于零(Krippendorff's α\alpha = 0.042)。在两个维度上,评测器的分歧超过了随机噪声的预测(α\alpha < 0)。然而这种分歧并非混乱;而是结构化的。一个分类器仅凭评分量表得分就能以 77.1% 的准确率识别出哪个评测器产生了某次评测,加入倾向特征后准确率提升至 89.9%。在模型家族内部,该信号更强:GPT-4.1 和 GPT-5.2 可以以 99.6% 的准确率区分。我们将此称为可靠性悖论:评测器无法就何为质量达成一致,但其分歧模式却如此稳定,以至于起到了指纹的作用。每个评测器都实现了一种独特且稳定的质量理论:一种“评测倾向”,塑造了它解读任何评分量表的方式。我们沿多个轴线刻画了这些倾向:严苛度/宽容度、维度侧重、评测器内部稳定性(ICC)以及证据行为(收据有效性、通过 NLI 的语义关联以及散射枪指数)。其含义是鲜明的:LLM 评测器并非测量共享构念的可互换工具。它们是各自独立的测量设备,每个都编码了自身的隐式质量理论。对其得分取平均会产生一个不对应于任何评测器实际价值观的合成评判。

关键词

引用

@article{arxiv.2601.05114,
  title  = {Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior},
  author = {Wajid Nasser},
  journal= {arXiv preprint arXiv:2601.05114},
  year   = {2026}
}

备注

23 pages, 6 figures, code and artifacts at : https://github.com/wajid-nasser/evaluative-fingerprints