中文

规模决定语言模型是否组织表示几何用于预测

机器学习 2026-05-19 v1 计算与语言

摘要

在语言模型中,一个表示编码的内容由其表示空间的几何结构决定:距离而非激活值携带意义。现有工具表征了这种几何的形状,但并未询问该形状为何被组织。我们引入子空间PCA (Subspace PGA),用于测试某一层的距离结构是否与解嵌入矩阵 WUW_U 的读出子空间相吻合程度高于随机子空间。我们发现,跨越七个Pythia模型(70M--6.9B)和三个跨家族模型,中间层几何显著组织用于预测(峰值 z=9z = 9--2424),但程度随规模而异:小模型(d1024d \leq 1024)在训练过程中逐渐丢失这一组织——即便如此,损失仍在改进;而大模型(d2048d \geq 2048)则在整个训练过程中保持其组织。我们将其归因于容量权衡:少数主导方向从 WUW_U 的读出方向迁移,掩盖而非破坏预测结构 beneath,而去除这些方向可恢复对齐。 neither 谱度量 nor 损失曲线 捕获这种区别。规模因此不仅决定模型预测的好坏,还决定其表示几何组织方式以实现此目的。

关键词

引用

@article{arxiv.2605.17084,
  title  = {Scale Determines Whether Language Models Organize Representation Geometry for Prediction},
  author = {Weilun Xu},
  journal= {arXiv preprint arXiv:2605.17084},
  year   = {2026}
}