语言模型的谱系比例律:前馈网络如何有效利用其潜在空间
机器学习
2025-10-02 v1 信息论
math.IT
摘要
随着大型语言模型 (LLM) 的规模扩大,问题不仅在于它们变得多大,更在于其容量被有效利用的程度。现有的比例律将模型大小与损失相关,却忽略了各组件如何利用其潜在空间。我们研究前馈网络 (FFN) 并将宽度选择重新诠释为谱利用问题。使用轻量级诊断套件——硬秩 (参与比率)、软秩 (香农秩)、谱浓度以及复合谱利用指数 (SUI)——我们量化 LLaMA、GPT-2 和 nGPT 系列中多少个潜在方向被有意义地激活。我们的关键发现是不对称的谱系比例律:软秩几乎完美地遵循 FFN 宽度的幂律,而硬秩仅增长亚线性且方差较大。这一不对称性表明,扩大 FFN 宽度主要添加低能尾部方向,而主导模态子空间早期即饱和。此外,在更大宽度下,方差进一步压缩到狭窄子空间中,导致潜在空间中大量未被充分利用。这些结果将 FFN 宽度选择重新诠释为尾部容量与主导模态容量之间的原则性权衡,为推断高效的 LLM 设计提供具体指导。
引用
@article{arxiv.2510.00537,
title = {Spectral Scaling Laws in Language Models: How Effectively Do Feed-Forward Networks Use Their Latent Space?},
author = {Nandan Kumar Jha and Brandon Reagen},
journal= {arXiv preprint arXiv:2510.00537},
year = {2025}
}
备注
EMNLP 2025 Main Conference (Long paper)