中文

层次重要性在数学推理中由预训练塑造,后训练后保持不变

机器学习 2025-11-06 v2 人工智能

摘要

大型语言模型在指令调优、强化学习或知识蒸馏后表现出数学能力提升。我们询问这些提升是否源于Transformer层的重大结构变化,还是仅由保持原有结构的细微调整所致。通过对基础模型和训练后模型进行层级消融分析,我们发现数学推理依赖于少数关键层,这些层在所有后训练方法中均保持重要性。移除这些层会使数学准确率下降最高达80%,而事实记忆任务仅显示相对较小的下降。这表明针对数学任务的专用层在预训练期间形成且随后保持稳定。根据归一化互信息(NMI)的测量,我们发现近这些关键层时,标记会从其原始的句法聚类漂移 toward表示与句法关系较弱但可能对下游任务更有用的标记对齐。

关键词

引用

@article{arxiv.2506.22638,
  title  = {Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training},
  author = {Aadim Nepal and Safal Shrestha and Anubhav Shrestha and Minwu Kim and Jalal Naghiyev and Ravid Shwartz-Ziv and Keith Ross},
  journal= {arXiv preprint arXiv:2506.22638},
  year   = {2025}
}