中文

LDLT L-Lipschitz 网络权重参数化初始化

机器学习 2026-01-14 v1

摘要

我们分析了基于 LDLT 的 L\mathcal{L}-Lipschitz 层的初始化动力学,通过推导当底层参数矩阵 W0Rm×nW_0\in \mathbb{R}^{m\times n} 使用独立同分布的高斯条目 N(0,σ2)\mathcal{N}(0,\sigma^2) 初始化时的精确边际输出方差。用于计算输出边际方差的 Wishart 分布 S=W0W0Wm(n,σ2Im)S=W_0W_0^\top\sim\mathcal{W}_m(n,\sigma^2 \boldsymbol{I}_m) 被推导得到闭式表达式,利用 zonal 多项式的期望通过 James 定理和 (αIm+S)1(\alpha \boldsymbol{I}_m+S)^{-1} 的 Laplace 积分展开。我们发展了基于 Isserlis/Wick 的组合展开 E[tr(Sk)]\operatorname{\mathbb{E}}\left[\operatorname{tr}(S^k)\right],并提供前 10 阶的显式截断矩,这些矩对小到中等 σ2\sigma^2 提供了准确的级数近似。蒙特卡罗实验确认了理论估计。此外,进行了经验分析,量化了使用当前 He 或 Kaiming 初始化并缩放为 1/n1/\sqrt{n} 时,输出方差为 0.410.41,而新参数化在 α=1\alpha=1 时使用 10/n10/ \sqrt{n} 结果为输出方差 0.90.9。这些发现阐明了为什么深层 L\mathcal{L}-Lipschitz 网络在初始化时会出现快速信息损失,并为选择初始化超参数以缓解此效果提供了实用建议。然而,使用希克斯 boson 分类数据集,对优化器、初始化尺度和深度进行了超参数扫描,以验证在真实数据上的结果,表明尽管推导确保了方差保持,经验结果表明 He 初始化仍表现更好。

关键词

引用

@article{arxiv.2601.08253,
  title  = {LDLT L-Lipschitz Network Weight Parameterization Initialization},
  author = {Marius F. R. Juston and Ramavarapu S. Sreenivas and Dustin Nottage and Ahmet Soylemezoglu},
  journal= {arXiv preprint arXiv:2601.08253},
  year   = {2026}
}

备注

12 pages, 17 figures