权重衰减使 Transformer 损失景观满足 Villani 条件:优化与泛化的泛函分析基础
机器学习
2026-05-08 v1 音频与语音处理
摘要
权重衰减被广泛用作大型语言模型的正则化器,但其在塑造 Transformer 损失景观中的确切作用在理论上仍探索不足。本文首次对标准 Transformer 目标函数——带 正则化的交叉熵损失——提供了严格的泛函分析刻画,证明其满足强制能量函数的 Villani 条件。具体而言,我们证明正则化损失 是无穷次可微的,至少呈二次增长,具有高斯可积尾部,并满足微分增长条件 (当 ,对所有 成立)。基于此结构,我们推导出显式的 log-Sobolev 和 Poincaré 常数 ,将正则化强度 和模型维度 与噪声随机梯度下降的有限时间收敛保证以及随 增大而收紧的 PAC-Bayesian 泛化界联系起来。为验证我们的理论,我们引入了可扩展的 Villani 诊断指标 ,并在参数量超过 100M 的模型中使用 Hutchinson 迹探测高效估计该指标。在 GPT-Neo-125M 上跨 Penn Treebank 和 WikiText-103 的实验证实了 预测的二次增长、Hessian 矩阵的谱膨胀,以及与我们的 log-Sobolev 分析相一致的指数收敛行为。这些结果表明,权重衰减不仅在经验上改善了泛化能力,还确立了深度学习中快速 Langevin 混合和具有理论基础的曲率感知优化所需的数学条件。
引用
@article{arxiv.2605.06599,
title = {Weight-Decay Turns Transformer Loss Landscapes Villani: Functional-Analytic Foundations for Optimization and Generalization},
author = {Abhijit Das and Sayantan Dutta},
journal= {arXiv preprint arXiv:2605.06599},
year = {2026}
}
备注
17 pages, 10 figures