误区:衡量大语言模型长期程式执行的递减报酬幻觉
人工智能
2026-03-16 v3
摘要
大型语言模型 (LLM) 的规模化是否yield递减报酬?本文显示,短任务基准可能制造一种假象,即使在单步准确率上仅有细微提升,也能复合为模型成功完成任务长度的指数性提升。随后,我们认为 LLM 在简单任务被延长后失败源于执行错误,而非推理能力不足。因此,我们提出通过显式提供解题所需的知识和计划来隔离执行能力。首先,我们发现更大的模型即使在小模型接近完美的单轮准确率下,能够正确执行显著多的轮次。随后我们观察到,随着步骤数量增加,模型的每步准确率会下降。这不仅仅是由于长上下文限制——令人惊讶的是,我们观察到一种自条件化效应——当上下文包含来自前几轮错误时的模型更容易出错。自条件化效应不会仅通过扩大模型规模来消除。但我们发现,思考能缓解自条件化效应,并也能在单轮中执行 much longer 的任务。我们通过在前沿思考模型上进行基准测试,衡量其单轮可执行任务的长度。总体而言,通过聚焦于执行能力,我们希望调和关于 LLM 如何解决复杂推理问题却在简单任务被延长后失败的争论,并凸显规模化模型规模和顺序测试时计算对长期程式任务的巨大利益。
引用
@article{arxiv.2509.09677,
title = {The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs},
author = {Akshit Sinha and Arvindh Arun and Shashwat Goel and Steffen Staab and Jonas Geiping},
journal= {arXiv preprint arXiv:2509.09677},
year = {2026}
}
备注
Published at ICLR 2026