探索大语言模型温度的影响:热或冷?
计算与语言
2025-06-10 v1
摘要
采样温度是大型语言模型(LLMs)中的关键超参数,它修改softmax层之前的logits,从而重塑输出标记的分布。近期研究挑战了随机鸽子类比,表明LLMs能够理解语义而不仅仅是记忆数据,随机性由采样温度调控在模型推理中发挥关键作用。本研究系统评估了温度在0至2范围内对六种不同能力的数据集的影响,对三种不同规模的开源模型进行统计分析:小型(1B-4B)、中型(6B-13B)和大型(40B-80B)。我们的发现揭示了温度对模型性能的技能特定效应,凸显实际应用中最优温度选择的复杂性。为解决此挑战,我们提出了一种基于BERT的温度选择器,利用这些观察到的效应识别给定提示的最优温度。我们展示了该方法可显著提高小型和中型模型在SuperGLUE数据集上的性能。此外,我们的研究扩展到FP16精度推理,表明温度效应与4位量化模型中观察到的一致。通过对三种量化模型进行温度效应评估至4.0,我们发现突变温度——即显著性能变化的临界点——随模型规模而增加。
引用
@article{arxiv.2506.07295,
title = {Exploring the Impact of Temperature on Large Language Models:Hot or Cold?},
author = {Lujun Li and Lama Sleem and Niccolo' Gentile and Geoffrey Nichil and Radu State},
journal= {arXiv preprint arXiv:2506.07295},
year = {2025}
}