中文

通过代数陷阱探测语言模型中的结构数学推理

机器学习 2026-05-07 v1 群论

摘要

我们引入了一个基准套件,用于评估语言模型中的结构数学推理,基于SL(3, Z)中子群构造问题,具有加密式验证者-证明者不对称性。每个实例呈现一个有限生成的子群作为整数矩阵列表,要求计算一个算术不变式——指数、素数上的投射或成员资格——该构造时间信息 (N, K) 在O(1)闭式中确定,但求解器缺乏该信息,必须通过Aschbacher分类分析或对SL(3, Z)中未知可判定性的成员查询来推导。该基准因此区分了具有内在代数先验(Aschbacher类、McLaughlin定理、Property (T)、同余子群性质)的模型与依赖通用计算的模型。我们报告了在五个代表性推理痕迹中对两个最先进模型的实证结果。头条结果:在指数变量上,一个模型花了152分钟进行推理,明确识别了kernel侧成员问题作为瓶颈,尝试进行构造性验证,并在其计算的 cokernel 候选者上 abstained,表现为 "DON'T KNOW" 而不是对未知可判定性边界的妥协——在设计用于探测的基准中表现出对开放可判定性边界的校准元认知。我们认为该基准暴露了一种四向模型行为分类(commit-correct, commit-wrong, abstain-correct, abstain-wrong),而标准答案-key评分将其混为一谈。

关键词

引用

@article{arxiv.2605.04352,
  title  = {Probing Structural Mathematical Reasoning in Language Models with Algebraic Trapdoors},
  author = {Igor Rivin},
  journal= {arXiv preprint arXiv:2605.04352},
  year   = {2026}
}