规模决定语言模型是否组织表示几何用于预测
机器学习
2026-05-19 v1 计算与语言
摘要
在语言模型中,一个表示编码的内容由其表示空间的几何结构决定:距离而非激活值携带意义。现有工具表征了这种几何的形状,但并未询问该形状为何被组织。我们引入子空间PCA (Subspace PGA),用于测试某一层的距离结构是否与解嵌入矩阵 的读出子空间相吻合程度高于随机子空间。我们发现,跨越七个Pythia模型(70M--6.9B)和三个跨家族模型,中间层几何显著组织用于预测(峰值 --),但程度随规模而异:小模型()在训练过程中逐渐丢失这一组织——即便如此,损失仍在改进;而大模型()则在整个训练过程中保持其组织。我们将其归因于容量权衡:少数主导方向从 的读出方向迁移,掩盖而非破坏预测结构 beneath,而去除这些方向可恢复对齐。 neither 谱度量 nor 损失曲线 捕获这种区别。规模因此不仅决定模型预测的好坏,还决定其表示几何组织方式以实现此目的。
引用
@article{arxiv.2605.17084,
title = {Scale Determines Whether Language Models Organize Representation Geometry for Prediction},
author = {Weilun Xu},
journal= {arXiv preprint arXiv:2605.17084},
year = {2026}
}