你能信任 LLM 的判断吗?LLM-as-a-Judge 的可靠性
计算与语言
2025-02-19 v2
摘要
大型语言模型(LLM)变得越来越强大和普及,但其随机性给其输出的可靠性带来了挑战。虽然确定性设置可以提高一致性,但它们并不能保证可靠性,因为从模型的概率分布中抽取的单个样本仍可能具有误导性。基于 LLM-as-a-judge 的概念,我们引入了一个新框架,利用 McDonald's omega 严格评估 LLM 判断的可靠性。我们评估了 LLM 在标准单轮和多轮基准测试中评判其他 LLM 输出时的可靠性,同时研究了温度对可靠性的影响。通过分析这些结果,我们展示了固定随机性的局限性以及考虑多个样本的重要性,并表明这对下游应用具有重大影响。我们的研究结果强调,需要细致入微地理解 LLM 的可靠性,以及过度依赖单次评估的潜在风险。这项工作为构建更值得信赖和可靠的基于 LLM 的系统与应用迈出了关键一步。
引用
@article{arxiv.2412.12509,
title = {Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge},
author = {Kayla Schroeder and Zach Wood-Doughty},
journal= {arXiv preprint arXiv:2412.12509},
year = {2025}
}