中文

同一输入,不同得分:LLM Judge 不一致性的多模型研究

计算与语言 2026-03-06 v1

摘要

大语言模型正在越来越多地被用作研究和企业场景中的自动评估器,这一实践被称为 LLM-as-a-judge。尽管先前工作检查了准确性、偏差和与人类偏好之间的一致性,但关于 LLM 分配数值得分稳定性的关注仍很少。本研究系统评估了五个常用模型——GPT-4o、GPT-4o-mini、Gemini-2.5-Flash、Claude-Haiku-4.5 和 Claude-Sonnet-4.5——在两种温度设置下以及来自检索增强生成(RAG)系统的真实企业问答对上的评分稳定性。我们回答了三个问题:模型在重复运行中得分的稳定性如何、不同模型对相同输入的打分差异如何、温度如何影响评分一致性。温度控制了 LLM 输出的确定性。尽管在温度为 0 时期望稳定,但我们观察到不同模型之间存在显著变异,完整性评分显示最大波动。跨模型比较揭示了模型在严谨性和解释风格上的系统性差异,导致对相同答案的评分差异。较低的温度对某些模型(如 GPT-4o 和 Gemini)的稳定性有所提升,但对 Anthropic 模型的影响有限或不一致。这些发现对依赖 LLM 生成得分进行路由、分流、筛选或质量控制的企业管道具有重要影响。相同的输入可能因模型、系列或温度而获得不同得分,这对公平性、可重复性和操作可靠性提出了担忧。我们的结果凸显了在生产环境中可靠地使用 LLM-as-a-judge 的必要性,包括监控、稳健解析和混合人类-LLM 评估策略。

关键词

引用

@article{arxiv.2603.04417,
  title  = {Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge},
  author = {Fiona Lau},
  journal= {arXiv preprint arXiv:2603.04417},
  year   = {2026}
}

备注

19 pages, 14 figures