大型语言模型中推理与性能的关系——o3 (mini) 思考更努力而非更长
机器学习
2025-02-24 v1 人工智能
摘要
大型语言模型在数学推理方面取得了显著进展,利用了思维链和测试时计算扩展。然而,关于推理token使用与准确率提升之间的相互作用仍有许多开放问题。特别是,当跨代比较模型时,尚不清楚性能的提升是来自更长的推理链还是更高效的推理。我们系统分析了 o1-mini 和 o3-mini 变体在 Omni-MATH 基准上的思维链长度,发现 o3-mini (m) 在不需要比 o1-mini 更长推理链的情况下取得了更优的准确率。此外,我们表明在所有模型和计算设置下,准确率通常随推理链的增长而下降,即使控制了问题的难度。这种准确率下降在更熟练的模型中显著更小,表明新一代推理模型更有效地利用测试时计算。最后,我们指出虽然 o3-mini (h) 相比 o3-mini (m) 取得了边际准确率提升,但它通过在所有问题上分配大量推理token来实现这一点,甚至包括 o3-mini (m) 已经能够解决的问题。这些发现为模型能力与推理长度之间的关系提供了新见解,对效率、扩展性和评估方法具有启示意义。
引用
@article{arxiv.2502.15631,
title = {The Relationship Between Reasoning and Performance in Large Language Models -- o3 (mini) Thinks Harder, Not Longer},
author = {Marthe Ballon and Andres Algaba and Vincent Ginis},
journal= {arXiv preprint arXiv:2502.15631},
year = {2025}
}
备注
19 pages, 11 figures