超越困惑度:低秩预训练的几何与谱研究
机器学习
2026-05-20 v2 人工智能
计算与语言
摘要
大型语言模型的预训练主要受存储完整秩权重、梯度和优化器状态内存成本的制约。低秩预训练已涌现为解决此问题的方法,其方法空间正在迅速增长。但一个核心问题仍悬而未决:低秩方法是否产生与完整秩训练相当的泛化能力,或者秩约束是否根本性地改变了所达到的解?现有比较几乎完全依赖于单随机运行的验证困惑度。然而,困惑度是衡量解质量的poor proxy;两种方法可以在困惑度上匹配,却收敛到不同的损失景观区域和内部表征中。我们通过对五种低秩预训练方法(GaLore和Fira的内存高效优化器、CoLA和SLTrain的架构重参数化、ReLoRA的带周期重置的适配器式更新)所找到的解进行表征,将其与完整秩训练进行比较,考察三个模型规模(60M、130M、350M)。我们沿着16项指标评估每个方法,涵盖四个维度:1.沿随机方向和top-K PCA方向的损失景观、2.在检查点之间的1维插值、3.权重和已学习更新的谱结构、4.与完整秩训练的激活相似性。我们显示,低秩方法与完整秩训练或彼此之间并不等价,即使验证困惑度接近。完整秩训练在随机方向上收敛于更陡峭的囊中,而在top-1 PCA方向上则恰恰相反。每种方法都收敛到几何上不同的囊中。随着训练进行,低秩激活在后续层中与完整秩训练发生发散,GaLore在跟踪完整秩训练方面最为紧密。此外,验证困惑度并不在每个规模上都转化为下游性能。加入几何和谱指标后,预测能力得到改善。
引用
@article{arxiv.2605.13652,
title = {Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training},
author = {Namrata Shivagunde and Vijeta Deshpande and Sherin Muckatira and Anna Rumshisky},
journal= {arXiv preprint arXiv:2605.13652},
year = {2026}
}
备注
9 pages, 5 figures, 2 tables