中文

论推理长度与正确性之间的关系:LLM 推理长度与正确性的实证研究

计算与语言 2025-05-02 v1 人工智能

摘要

大型语言模型 (LLM) 正在不断优化以进行长推理,假设更多的推理会导致更好的性能。然而,越来越多的证据表明,更长的响应有时会降低准确性而非提高。本文我们进行了关于推理长度与答案正确性之间关系的系统实证研究。我们发现,LLM 倾向于对简单问题进行过度思考,生成不必要的冗长输出,同时对更难的问题进行不足思考,未能在最需要时延长推理。这表明模型可能误判问题难度,未能对响应长度进行恰当的校准。此外,我们研究了在仅偏好更短的响应(不考虑答案正确性)的情况下进行长度缩减的效果。实验表明,在保持可接受准确性的前提下,可以显著减少生成长度。我们的发现将生成长度作为推理行为的有意义信号,激励进一步探索 LLM 在推理长度自适应方面的自我意识。

关键词

引用

@article{arxiv.2505.00127,
  title  = {Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs},
  author = {Jinyan Su and Jennifer Healey and Preslav Nakov and Claire Cardie},
  journal= {arXiv preprint arXiv:2505.00127},
  year   = {2025}
}