中文

ReasonBENCH:基准测试大语言模型推理的(不)稳定性

人工智能 2025-12-09 v1 计算与语言 机器学习

摘要

大语言模型(LLMs)越来越多地部署在需要推理(如多步问题求解和思维链)的场景中。然而,当前的评估实践绝大多数只报告单次运行的准确率,而忽略了随机解码自然产生的内在不确定性。这一遗漏造成了一个盲点,因为从业者无法可靠地评估一种方法报告的性能是否稳定、可复现或成本一致。我们引入了ReasonBENCH,这是首个旨在量化LLM推理中潜在不稳定性的基准。ReasonBENCH提供了(i)一个标准化推理框架、模型和任务的模块化评估库,(ii)一个多轮运行协议,报告质量和成本方面统计上可靠的指标,以及(iii)一个鼓励方差感知报告的公开排行榜。在来自不同领域的任务中,我们发现绝大多数推理策略和模型都表现出高度不稳定性。值得注意的是,即使平均性能相似的策略,其置信区间也可能宽达四倍,并且性能最佳的方法往往产生更高且更不稳定的成本。这种不稳定性损害了跨运行的可复现性,进而影响了报告性能的可靠性。为了更好地理解这些动态,我们进一步分析了提示、模型家族和规模对求解率与稳定性之间权衡的影响。我们的结果突显了可复现性作为可靠LLM推理的一个关键维度,并为未来的推理方法和不确定性量化技术提供了基础。ReasonBENCH已在https://github.com/au-clan/ReasonBench上公开提供。

关键词

引用

@article{arxiv.2512.07795,
  title  = {ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning},
  author = {Nearchos Potamitis and Lars Klein and Akhil Arora},
  journal= {arXiv preprint arXiv:2512.07795},
  year   = {2025}
}

备注

11 pages, 3 tables, 4 figures