中文

解构LLM的数学推理:内部机制的方法论探究

计算与语言 2026-04-20 v1

摘要

大型语言模型(LLMs)已展现出惊人的能力,但其处理推理密集型任务的内部机制仍鲜有探索。为推进对模型内部处理机制的理解,我们present对LLM执行算术运算时内部机制的调查研究。通过early解码,我们追踪跨层次如何构建下一个token预测。我们的实验表明,虽然模型在早期即识别出算术任务,但正确的结果生成仅在最终层才发生。值得注意的是,擅长算术的模型在注意力和MLP模块之间 exhibits出明确的职责分工,其中注意力传递输入信息,MLP模块对其进行聚合。而在性能较差的模型中则不存在这种分工。此外,成功的模型似乎在处理更具挑战性的算术任务时采用功能性方法,暗示其推理能力超越了事实记忆。

关键词

引用

@article{arxiv.2604.15842,
  title  = {Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms},
  author = {Tanja Baeumel and Josef van Genabith and Simon Ostermann},
  journal= {arXiv preprint arXiv:2604.15842},
  year   = {2026}
}

备注

MathNLP 2025