中文

超越准确率:诊断大语言模型在九维代数推理复杂度中的故障

计算与语言 2026-04-09 v1 计算机与社会

摘要

代数推理是大语言模型最具信息性的压力测试之一,但当前基准缺乏对故障原因归因的机制。当模型对代数问题失误时,单一的准确率分数无法揭示是表达式嵌套过深、运算符过于罕见、中间状态数量过多,还是依赖链过长。以往工作在孤立环境中研究 individual failure modes,但尚无框架能在严格的实验控制下独立变更每一复杂度因子。更无系统能自动生成并验证复杂度递增的问题,以追踪模型的进步。我们引入九维代数复杂度框架,独立变更每个因子,同时保持其他因子固定,通过参数化管道实现问题的生成与验证,无需人工标注。每个维度都基于文档化的大语言模型故障模式,捕捉代数难度的结构性不同方面,包括表达式嵌套深度、同时中间结果数量、子表达式复杂度、运算符难度以及依赖推理链长度。我们评估了跨8B至235B参数量的七个指令调优模型,发现工作记忆是支配性可尺度不变的瓶颈。每个模型在20至30个平行分支处都会崩溃,这指向的是硬性架构约束而非可解决的容量限制。我们的分析进一步识别出最小且诊断充分的五个维度子集,完整覆盖文档化的代数故障模式,为模型的代数推理能力提供完整的复杂度轮廓。

关键词

引用

@article{arxiv.2604.06799,
  title  = {Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions},
  author = {Parth Patil and Dhruv Kumar and Yash Sinha and Murari Mandal},
  journal= {arXiv preprint arXiv:2604.06799},
  year   = {2026}
}

备注

Under Review as a conference paper at COLM 2026