NerVE:大语言模型前馈网络中的非线性本征谱动力学
机器学习
2026-03-17 v2
摘要
我们提出NerVE,一个用于理解大语言模型(LLMs)中前馈网络(FFNs)如何在高维潜在空间中组织和调节信息流的统一本征谱框架。尽管 FFNs 占据参数预算的主导地位,但其高维动力学仍鲜有了解。NerVE 通过四种互补指标跟踪本征谱动力学:谱熵(离散性)、参与比(有效维度)、特征值早期富集(顶部偏重)以及 Jensen-Shannon 散度(分布迁移)。我们的关键洞察是,FFNs 非线性会将方差重新注入本征模态中,从而基本决定潜在维度的利用情况,并且优化器几何强烈影响这种方差重新注入的程度。我们在不同模型规模、多样化的架构和优化器配置下进行了验证,每种配置独特地塑造了 FFNs 的动力学:归一化方案控制方差流动;FFN 权重几何限制潜在空间;位置编码和激活函数调节信息流动;以及优化器选择在深度中重新分配有效容量。在这些设置下,NerVE 持续恢复稳定的谱特征,这些特征与模型的泛化能力相关联,并对设计选择作出可预测响应,超越 Transformer 到 MLP-Mixer 架构,为架构和优化器选择提供可操作的见解,超越试错的方式。
引用
@article{arxiv.2603.06922,
title = {NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks},
author = {Nandan Kumar Jha and Brandon Reagen},
journal= {arXiv preprint arXiv:2603.06922},
year = {2026}
}
备注
Accepted to ICLR 2026. Project page: https://nerve-eigenspectrum.github.io