中文

温度对扩展推理大语言模型提示策略性能的影响

计算与语言 2026-04-13 v1 人工智能 机器学习

摘要

扩展推理模型代表了大语言模型(LLM)能力的变革性转变,通过显式的测试时计算实现复杂问题的解决。然而,对于这些系统而言,抽样温度和提示策略的最优配置仍在很大程度上未被探索。我们系统评估了链式思维(chain-of-thought)和零shot提示策略,在四个温度设置(0.0、0.4、0.7和1.0)下使用Grok-4.1进行扩展推理,测试39个来自AMO-Bench的数学问题,这是一个具有挑战性的国际数学奥林匹克水平基准。我们发现,零shot提示在适中温度下达到最佳性能,在T=0.4和T=0.7时达到59%的准确率,而链式思维提示在温度极端值时表现最佳。最值得注意的是,随着温度从T=0.0增加到T=1.0,扩展推理的优势从6倍增长到14.3倍。这些结果表明,温度应与提示策略一起优化,这挑战了在推理任务中常用T=0的做法。

关键词

引用

@article{arxiv.2604.08563,
  title  = {Temperature-Dependent Performance of Prompting Strategies in Extended Reasoning Large Language Models},
  author = {Mousa Salah and Amgad Muneer},
  journal= {arXiv preprint arXiv:2604.08563},
  year   = {2026}
}

备注

3 Figures, 2 Tables