LLM-as-a-Judge实证研究:设计选择如何影响评估可靠性
计算与语言
2025-06-17 v1
摘要
随着大型语言模型(LLM)的不断进步, 可靠的评估方法尤为重要, 尤其是对于开放式、遵循指令的任务。LLM-as-a-Judge使用LLM作为评估器实现自动评估, 但其可靠性仍存疑虑。本文我们分析影响其可信度的关键因素, 关注与人类判断的一致性以及评估一致性。我们使用BIGGENBench和EvalBiasBench, 研究评估设计、解码策略和链条推理(CoT)在评估中的影响。我们的结果表明, 评估标准对可靠性至关重要, 非确定性抽样在与人类偏好一致性方面优于确定性评估, 而在存在明确评估标准时, CoT推理的提升有限。
引用
@article{arxiv.2506.13639,
title = {An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability},
author = {Yusuke Yamauchi and Taro Yano and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2506.13639},
year = {2025}
}