太长;没解决
人工智能
2026-04-10 v1
摘要
由数学基准组成的多种数学问题被广泛用于评估大型语言模型的推理能力,但关于其结构属性如何影响模型行为的了解仍很有限。本文调查了两种结构长度变量,即提示长度和解答长度,并分析它们与模型在新构建的专家编写数学问题对抗数据集上的表现之间的关系。我们发现,提示长度和解答长度都与模型失败率的增加呈正相关。我们还包括对跨模型不一致性的次要探索性分析。在难度调整后的标准化分析下,两种变量均保持弱负相关,提示长度的负相关稍强一些。总体而言,我们的主要稳健发现是,结构长度与本数据集中的经验难度相关联。
引用
@article{arxiv.2604.07593,
title = {Too long; didn't solve},
author = {Lucía M. Cabrera and Isaac Saxton-Knight},
journal= {arXiv preprint arXiv:2604.07593},
year = {2026}
}