中文

少即是多:LLM 数学推理中的认知负荷与单提示上限

计算与语言 2026-04-22 v1 机器学习

摘要

我们在 SAIR 等式理论第一阶段竞赛的背景下,对形式化数学推理的提示工程进行了系统的实证研究。该任务要求判定一个等式律是否在所有 magma 上蕴含另一个等式律——该问题在一般情况下不可判定,但通过有限模型搜索对 FALSE 情形是可判定的。在五周时间内,我们设计、测试并分析了超过 40 种提示变体,字节长度从 0 到 4,878 字节不等,涵盖了四个评估划分和三个语言模型(gpt-oss-120b、Llama 3.3 70B、Gemma 4 31B)。我们的核心发现是单提示上限:尽管付出了大量的工程努力,gpt-oss-120b 的平衡硬准确率停滞在约 60%--79% 的经验饱和区间,而无提示基线为 59.75%。我们识别出导致该上限的三个机制:(1) TRUE 情形的数学不可判定性限制了任何有限提示所能编码的内容;(2) 复杂的规则系统会降低较弱模型的性能(Llama 3.3 70B 在提示超过 2KB 时 TRUE 召回率骤降至 0%);(3) 提示顺序效应以脆弱且非单调的方式与模型注意力产生交互。我们最佳的提交(AN45c,2,252 字节)在 hard3 上达到了 79.25% 的准确率(n=400;95% CI: [75.0%, 82.9%]),TRUE 召回率为 95.9%,FALSE 召回率为 63.4%,相比无提示基线(59.75%)提升了 19.5 个百分点。我们在 https://github.com/israelcazares/sair-prompt-engineering 发布了所有提示变体、评估脚本和结果。

关键词

引用

@article{arxiv.2604.18897,
  title  = {Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning},
  author = {Manuel Israel Cazares},
  journal= {arXiv preprint arXiv:2604.18897},
  year   = {2026}
}

备注

Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)