大语言模型如何及为何泛化:从认知行为到低层模式的细粒度分析
机器学习
2026-01-01 v1
摘要
大语言模型(LLM)展现出截然不同的泛化行为:监督微调(SFT)常常缩小能力范围,而强化学习(RL)调优则倾向于保持能力。这种差异背后的原因尚不清楚,因为先前的研究主要依赖于粗粒度的准确率指标。我们通过引入一个新的基准来解决这一空白,该基准将推理分解为原子核心技能,如计算、事实检索、模拟、枚举和诊断,为探讨LLM中推理构成这一根本问题提供了一个具体的框架。通过隔离和衡量这些核心技能,该基准提供了关于特定认知能力在训练后阶段如何涌现、迁移以及有时崩溃的更细粒度视角。结合对分布散度和参数统计等低层统计模式的分析,它使得我们能够对SFT和RL下泛化如何在数学、科学推理和非推理任务中演化进行细粒度研究。我们的元探测框架跟踪了模型在不同训练阶段的行为,并揭示出RL调优的模型维持了更稳定的行为模式,并抵抗推理技能的崩溃,而SFT模型则表现出更剧烈的漂移,并过拟合于表面模式。这项工作为LLM中推理的本质提供了新的见解,并指出了设计能够促进广泛、鲁棒泛化的训练策略的原则。
引用
@article{arxiv.2512.24063,
title = {How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns},
author = {Haoyue Bai and Yiyou Sun and Wenjie Hu and Shi Qiu and Maggie Ziyu Huan and Peiyang Song and Robert Nowak and Dawn Song},
journal= {arXiv preprint arXiv:2512.24063},
year = {2026}
}