中文

温度设置在 LLM 评判器中的必要性

计算与语言 2026-03-31 v1

摘要

LLM 评判器作为一种有效且低成本的文本质量与事实正确性评估范式,已显示出与人类专家之间 substantial 的一致性,即便是在难以自动评估的任务上。实践中,研究人员常在评估过程中采用固定温度配置,最常见的取值为 0.1 和 1.0,这种做法主要是经验性而非原则性的。然而,近期研究表明,LLM 对温度设置表现出显著的敏感性,低温度并不一定能产生最优结果,且此类效果高度取决于具体任务。这引出一个关键研究问题:温度是否影响 LLM 评判器在评估中的表现?为此,我们通过一系列受控实验系统性地探讨温度与评判器性能之间的关系,并进一步在经验统计分析中采用因果推断框架,严格检验温度对评判器行为的直接因果效应,为 LLM 评估管道设计提供可操作的工程见解。

关键词

引用

@article{arxiv.2603.28304,
  title  = {The Necessity of Setting Temperature in LLM-as-a-Judge},
  author = {Lujun Li and Lama Sleem and Yangjie Xu and Yewei Song and Aolin Jia and Jerome Francois and Radu State},
  journal= {arXiv preprint arXiv:2603.28304},
  year   = {2026}
}