中文

从预训练到后训练:语言模型表示几何的追踪

机器学习 2025-09-30 v1 人工智能 计算与语言

摘要

标准的训练指标如损失函数难以解释大型语言模型中复杂能力的出现。我们采用谱方法来探究跨预训练和后训练过程中学习表示的几何结构,测量有效秩(RankMe)和特征谱衰减(α\alpha-ReQ)。以 OLMo(1B-7B)和 Pythia(160M-12B)模型为例,我们发现自监督预训练期间,语言模型呈现出三阶段几何相位的一致非单调序列。初始"热身"阶段表现为快速的表示坍缩。这一阶段后进入"熵寻求"阶段,在此阶段流形的维度显著扩大,与 n-gram 记忆达到峰值相吻合。随后进入"压缩寻求"阶段,在此阶段实施各向异性Consolidation, selectively 保留沿主导特征方向的方差,同时收缩其他方向,此转变伴随着下游任务性能显著提升。我们表明,这些相位可源于交叉熵优化在不平衡 token 频率下的相互作用以及表示瓶颈(dVd \ll |V|)的存在。后训练进一步改变几何结构:SFT 和 DPO 驱动"熵寻求"动力学,以整合特定指令或偏好数据,提升在分布内性能但降低在分布外鲁棒性;相反,RLVR 诱导"压缩寻求",增强奖励对齐但减少生成多样性。

关键词

引用

@article{arxiv.2509.23024,
  title  = {Tracing the Representation Geometry of Language Models from Pretraining to Post-training},
  author = {Melody Zixuan Li and Kumar Krishna Agrawal and Arna Ghosh and Komal Kumar Teru and Adam Santoro and Guillaume Lajoie and Blake A. Richards},
  journal= {arXiv preprint arXiv:2509.23024},
  year   = {2025}
}

备注

33 pages, 14 figures, 9 tables